Chấm điểm, tìm kiếm và pipeline cấu trúc hóa dữ liệu của bạn
Chúng tôi biến các nguồn thô, hỗn độn thành dữ liệu có cấu trúc mà sản phẩm của bạn có thể xếp hạng, tìm kiếm và khớp. Đó là engine chấm điểm cá nhân hóa kết quả theo từng người dùng, tìm kiếm toàn văn và theo vị trí cho cảm giác tức thì, và pipeline nạp dữ liệu làm sạch cùng khử trùng lặp dữ liệu ngoài thành thứ bạn tin được — xây trên PostgreSQL, nên không có dịch vụ tìm kiếm riêng phải vận hành hay trả phí.
Kỹ thuật, nói gọn.
Logic nằm trong SQL
Chấm điểm, phân loại và suy luận danh mục chạy như SQL tất định trên các cột dẫn xuất — nhanh, kiểm toán được và giải thích được, không tốn chi phí LLM và không phỏng đoán. Cùng một truy vấn cho cùng một kết quả mọi lúc.
Tìm kiếm bên trong Postgres
Tìm kiếm toàn văn và mờ dùng pg_trgm và unaccent nên lỗi gõ và dấu vẫn khớp, giữ tìm kiếm trong cơ sở dữ liệu sẵn có thay vì một cụm Elasticsearch riêng phải vận hành và đồng bộ.
Chế độ chấm điểm theo người dùng
Xếp hạng được tham số hóa theo hồ sơ và chế độ của người dùng, nên cùng một danh mục tự sắp xếp lại cho từng người — chặt hay nới, gần hay liên quan — bằng cách tính lại trọng số lúc truy vấn thay vì cố định một thứ tự.
Tìm kiếm bản đồ mở rộng tốt
Truy vấn địa lý dùng khoảng cách haversine cho tìm quanh đây và Supercluster cho phân cụm, nên hàng nghìn ghim vẫn mượt trên bản đồ và kết quả đúng nổi lên khi người dùng kéo và phóng to.
Từ khởi động đến ra mắt.
- 1
Phác họa nguồn dữ liệu
Chúng tôi kiểm kê các đầu vào thô — feed, scrape, export — và xác định hình dạng sạch, có cấu trúc mà sản phẩm thật sự cần để xếp hạng và tìm kiếm.
- 2
Xây pipeline
Chúng tôi viết phần nạp dữ liệu phân tích, chuẩn hóa, khử trùng lặp và làm giàu từng nguồn, với kiểm tra hợp lệ loại bỏ hoặc gắn cờ bản ghi xấu thay vì làm bẩn danh mục.
- 3
Thêm chấm điểm và tìm kiếm
Chúng tôi lồng vào engine chấm điểm, tìm kiếm toàn văn và theo vị trí, và tinh chỉnh độ liên quan trên truy vấn thật cùng dữ liệu thật, không phải mẫu tổng hợp.
- 4
Kiểm chứng và ra mắt
Chúng tôi test xếp hạng và nạp dữ liệu trên đầu vào đã biết, đo hiệu năng truy vấn ở khối lượng thực tế và triển khai với chỉ mục cùng job nạp lại sẵn sàng.
Sản phẩm bàn giao và khi nào phù hợp.
Bàn giao
- Pipeline nạp dữ liệu biến nguồn ngoài thô thành bản ghi sạch, có cấu trúc, đã khử trùng lặp
- Engine chấm điểm/xếp hạng với cá nhân hóa theo người dùng hoặc theo chế độ, hiện thực trong SQL
- Tìm kiếm toàn văn và mờ chịu được lỗi gõ và dấu, cộng bộ lọc luôn nhanh ở quy mô lớn
- Tìm kiếm địa lý: truy vấn khoảng cách quanh đây và phân cụm bản đồ sẵn sàng cho hàng nghìn điểm
- Chỉ mục, cột dẫn xuất và job nạp lại được tài liệu hóa để hệ thống luôn nhanh khi dữ liệu lớn dần
- Test bao phủ logic xếp hạng và tính đúng của pipeline trên đầu vào đã biết
Phù hợp khi
- Bạn tổng hợp dữ liệu từ nhiều nguồn ngoài và cần nó sạch, đã khử trùng lặp và truy vấn được
- Bạn muốn xếp hạng hoặc chấm điểm cá nhân hóa mà không chịu chi phí và sự khó lường của LLM
- Bạn cần tìm kiếm toàn văn hoặc theo bản đồ nhanh nhưng không muốn vận hành một cụm tìm kiếm riêng
- Danh mục của bạn đã vượt quá bộ lọc đơn giản và tìm kiếm giờ chậm hoặc thiếu liên quan
Đã ra mắt một pipeline biến ~1.500 tin thô còn ~1.200 bản ghi sạch, đã khử trùng lặp với phân cụm bản đồ và tìm quanh đây, cùng một engine chấm điểm riêng cá nhân hóa gợi ý hoàn toàn trong SQL.
Muốn điều này cho sản phẩm của bạn?
Cho chúng tôi biết mục tiêu — chúng tôi ước lượng trung thực.