Khuyến nghị chính của bài viết: bắt đầu với mô hình generally-available thông minh nhất hiện có, rồi dùng effort level để tinh chỉnh hiệu năng và chi phí - thay vì chọn sẵn một mô hình rẻ hơn rồi cố nới rộng năng lực của nó. Lý do: mô hình mạnh hơn thường hoàn thành tác vụ trong ít lượt hơn, nên dù đơn giá mỗi token cao hơn, chi phí tính trên mỗi tác vụ hoàn chỉnh (cost-per-task) đôi khi lại thấp hơn.
Bốn dòng mô hình Claude
Phần tiêu đề “Bốn dòng mô hình Claude”- Mythos / Fable - năng lực ở mức frontier, nổi bật nhất ở coding và các tác vụ agent chạy dài. Mythos dành riêng cho các tổ chức đã được xác minh và tin cậy; Fable là bản công khai hơn, có thêm lớp bảo vệ cho mục đích sử dụng đại chúng.
- Opus - mạnh cho các tác vụ doanh nghiệp đòi hỏi suy luận sâu, xếp hạng cao trên nhiều benchmark ngành.
- Sonnet - mô hình đa dụng, cân bằng giữa hiệu năng, chi phí và tốc độ, phù hợp với phần lớn use case hằng ngày.
- Haiku - chi phí thấp nhất, nhanh nhất, dành cho khối lượng công việc tần suất cao.
Khung 4 câu hỏi để chọn mô hình
Phần tiêu đề “Khung 4 câu hỏi để chọn mô hình”- Tác vụ khó đến mức nào?
- Yêu cầu độ trễ (latency) ra sao?
- Có ràng buộc gì về quyền truy cập không?
- Bài toán kinh tế đơn vị (unit economics) của tác vụ này như thế nào?
Bài viết nhấn mạnh: mọi mô hình Claude đều được huấn luyện cho coding, tác vụ agentic và công việc tri thức - khác biệt nằm ở độ khó bài toán mà mỗi mô hình xử lý tốt và chi phí đi kèm, không phải ở việc mô hình nào “biết làm” việc gì.
Chiến lược “advisor”
Phần tiêu đề “Chiến lược “advisor””Một chiến lược đáng chú ý: dùng mô hình “worker” nhanh, rẻ để xử lý phần lớn công việc, và để nó tham vấn một mô hình mạnh hơn khi cần xác thực kết quả - cách làm này có thể đạt hiệu năng gần bằng việc dùng mô hình flagship xuyên suốt, với chi phí thấp hơn đáng kể.
Cách đánh giá mô hình phù hợp
Phần tiêu đề “Cách đánh giá mô hình phù hợp”Bài viết khuyến nghị không chỉ dựa vào benchmark chuẩn của ngành, mà nên xây thêm bộ đánh giá tuỳ chỉnh (custom evaluation) lấy dữ liệu từ chính workload thực tế của tổ chức - vì “đủ tốt” cho một benchmark công khai không đồng nghĩa với “đủ tốt” cho bài toán cụ thể của bạn.
lượt xem