Caching – Harnesses and advisors: Building on Claude at GitHub scale

Cách GitHub tích hợp và tối ưu hóa các mô hình ngôn ngữ lớn (LLM) của Claude (Anthropic) vào hệ sinh thái GitHub Copilot để phục vụ hàng triệu lập trình viên. Mario Rodriguez (CPO của GitHub) và Brad Abrams (Trưởng bộ phận Quản lý Sản phẩm tại Anthropic) đã chia sẻ 3 chiến thuật cốt lõi giúp hệ thống hoạt động hiệu quả, chính xác và tiết kiệm chi phí ở quy mô cực lớn.

1. Prompt Caching (Lưu bộ nhớ đệm lời nhắc)

Đây là yếu tố sống còn để duy trì hiệu năng và tối ưu chi phí khi xử lý hàng tỷ tin nhắn.

Chỉ cần cải thiện 1% hiệu quả lưu trữ đệm cũng có thể tiết kiệm hàng triệu USD cho GitHub.

Cách tối ưu hóa:

  • Giữ cho các System Prompt (lời nhắc hệ thống) ổn định nhất có thể, tránh nội dung động (như UUID) ở phần tiền tố (prefix) vì nó sẽ làm mất hiệu lực của bộ nhớ đệm.
  • Quản lý chặt chẽ các công cụ (tools) đi kèm để tránh làm thay đổi cấu trúc prompt liên tục.
  • Duy trì “Cache affinity” (độ tương đồng bộ nhớ đệm) ngay cả trong môi trường sử dụng nhiều mô hình khác nhau cùng lúc.

2. Advisor Strategy (Chiến lược Cố vấn)

Chiến thuật này giúp cân bằng giữa trí thông minh cao và chi phí thấp.

Cơ chế: Kết hợp mô hình nhỏ (như Haiku/Sonnet – Executor) để thực thi các tác vụ thông thường và mô hình lớn (như Opus – Advisor) để tư vấn khi gặp bài toán khó.

Lợi ích: GitHub đạt được trí thông minh tương đương mô hình Opus nhưng với mức giá và tốc độ của các mô hình thấp hơn.

Rubber Duck: Một biến thể của chiến lược này, trong đó mô hình Opus đóng vai trò phản biện (critique) để kiểm tra lỗi trước khi thực thi kế hoạch hoặc chạy các bộ thử nghiệm (test suite) tốn kém.

3. Quy trình Đo lường và Tối ưu hóa (Measurement)

GitHub áp dụng một quy trình khắt khe để đảm bảo các mô hình mới luôn mang lại giá trị thực tế.

Quy trình 3 bước:

  • Tối ưu hóa “harness” (khung tích hợp) gồm system prompt và giao diện công cụ.
  • Chạy các thử nghiệm ngoại tuyến (offline benchmarks) và thử nghiệm nội bộ (dogfooding).
  • Thực hiện A/B testing trực tuyến sau khi ra mắt để tinh chỉnh dựa trên dữ liệu thực.

Thay vì chỉ nhìn vào tỉ lệ chấp nhận code (acceptance rate), GitHub tập trung vào Survival Rate (tỉ lệ mã nguồn thực sự tồn tại lâu dài) để đánh giá hiệu quả thực sự của AI đối với lập trình viên.

Thông qua việc kết hợp chặt chẽ với Anthropic, GitHub đã xây dựng được một hệ thống AI có khả năng:

  • Giữ cho lập trình viên luôn trong trạng thái tập trung (flow).
  • Tăng tốc độ làm việc của các nhóm phát triển.
  • Xây dựng sự tin tưởng và khả năng mở rộng cho doanh nghiệp.

Building on Claude

Bạn có thể cũng thích những nội dung này!