Triển khai hệ thống AI

Triển khai AI là phần việc nằm giữa một bản demo gây ấn tượng và một hệ thống bạn dám đưa tới khách hàng. Mô hình hiếm khi là phần khó. Phần khó là bộ đánh giá đáng tin, độ trễ và chi phí trụ được với lưu lượng thật, và hành vi vẫn chấp nhận được khi người dùng làm những điều không ai lường trước. Chúng tôi xây hệ thống AI đúng như xây mọi hệ thống production khác: có kiểm thử, có giám sát, và có đường quay lui.

Vì sao bản thử nghiệm AI mắc kẹt trước production

Phần lớn đội ngũ đạt tới một bản demo thuyết phục rất nhanh rồi dừng lại. Lý do lặp đi lặp lại, và không lý do nào liên quan tới việc chọn mô hình.

  • Không có bộ đánh giá, nên không ai biết một thay đổi làm tốt lên hay tệ đi.
  • Chi phí vốn không đáng kể lúc thử nghiệm trở thành khoản lớn nhất ở lưu lượng thật.
  • Độ trễ ổn với một người dùng trở nên không chấp nhận được khi request xếp hàng.
  • Không có phương án cho những trường hợp mô hình sai một cách rất tự tin.
  • Không ghi lại gì, nên lỗi không tái hiện được và không giải thích được với khách hàng.

Chúng tôi xây gì trước tiên

Trước khi thêm năng lực, chúng tôi làm cho hệ thống đo được. Nếu không, mọi thay đổi sau đó đều là phỏng đoán.

  • Bộ đánh giá lấy từ dữ liệu thật của bạn, bao gồm cả các ca lỗi.
  • Chấm điểm tự động trong CI, để mỗi thay đổi prompt hay mô hình là một sự kiện đo được.
  • Trace trên mọi lời gọi: đầu vào, đầu ra, độ trễ, số token và chi phí từng request.
  • Một lớp chắn cho những đầu ra tuyệt đối không được tới người dùng mà chưa kiểm tra.

Chọn phương án nhỏ nhất mà vẫn giải quyết được

Fine-tuning, retrieval, agent, và mô hình lớn hơn là bốn câu trả lời cho bốn vấn đề khác nhau, và thường xuyên bị áp dụng nhầm chỗ. Retrieval khắc phục việc thiếu kiến thức. Fine-tuning khắc phục định dạng và giọng văn. Agent khắc phục quy trình nhiều bước. Mô hình lớn hơn khắc phục độ sâu suy luận, kèm chi phí. Chúng tôi chẩn đoán bạn đang gặp vấn đề nào trước khi xây, vì phương án đắt tiền thường đang giải quyết một vấn đề bạn không có.

Giữ chi phí chịu được ở quy mô lớn

Chi phí AI tăng theo mức sử dụng theo cách mà phần lớn phần mềm khác không có, và một hệ thống có lãi ở mức nghìn request mỗi ngày có thể phá sản ở mức trăm nghìn. Chúng tôi thiết kế cho điều đó ngay từ đầu.

  • Cache cho những request lặp lại — thường nhiều hơn mức người ta tưởng.
  • Định tuyến request đơn giản sang mô hình nhỏ, dành mô hình lớn cho ca khó.
  • Cắt gọn prompt và ngữ cảnh, dựa trên đo đạc chứ không phải phỏng đoán.
  • Bảng theo dõi chi phí theo từng tính năng, để đường tốn kém lộ ra trước khi có hóa đơn.

Khi nào chúng tôi khuyên bạn đừng dùng AI

Rất nhiều bài toán được trình bày như bài toán AI thực chất là bài toán tìm kiếm, bài toán quy tắc, hoặc bài toán chất lượng dữ liệu, và giải theo cách thông thường thì rẻ hơn, nhanh hơn, dễ đoán hơn. Nếu chúng tôi thấy vậy, chúng tôi sẽ nói. Một hệ gợi ý là truy vấn được tinh chỉnh tốt vẫn hơn một hệ gợi ý bịa ra kết quả, và chi phí vận hành chỉ bằng một phần nhỏ.

Câu hỏi thường gặp

Chúng tôi có cần mô hình riêng không?
Gần như không bao giờ. Phần lớn hệ thống production dùng mô hình được lưu trữ sẵn, kết hợp retrieval và prompt tốt. Việc tự huấn luyện hoặc fine-tune chỉ đáng với các tác vụ hẹp, lưu lượng lớn, nhạy về định dạng — và đó là cam kết lớn hơn nhiều. Chúng tôi sẽ nói bạn thuộc trường hợp nào trước khi bạn chi tiền.
Làm sao ngăn nó đưa ra câu trả lời sai?
Không thể loại bỏ hoàn toàn, nên hệ thống phải xử lý được điều đó. Nghĩa là neo câu trả lời vào dữ liệu của bạn kèm trích dẫn, kiểm tra đầu ra có cấu trúc theo schema, chặn các hành động rủi ro cao sau bước xác nhận của con người, và ghi log đủ để giải thích lại bất kỳ câu trả lời cụ thể nào.
Có chạy được trên hạ tầng của chúng tôi không?
Có, khi dữ liệu đòi hỏi vậy. Tự vận hành mô hình mã nguồn mở là đánh đổi chi phí API lấy chi phí vận hành và trần năng lực thấp hơn. Đánh đổi đó đáng với một số khối dữ liệu nhạy cảm và không đáng với số khác — chúng tôi sẽ nói cụ thể trường hợp nào.
Đo thế nào là đủ tốt?
Đo trên bộ đánh giá xây từ dữ liệu của bạn với tiêu chí đạt đã thống nhất, trước khi ra mắt. "Có vẻ tốt hơn" không phải tiêu chí phát hành, và không có mốc gốc thì không ai biết thay đổi kế tiếp có giúp ích hay không.

Cho chúng tôi biết bạn đang xây gì

Gửi mô tả ngắn về hệ thống và điểm nghẽn bạn đang gặp. Chúng tôi trả lời trong vòng một ngày làm việc.

Đặt lịch tư vấn