Claude: Blog (Web)
88

Thủ thuật

CTO JetBrains chia sẻ chiến lược đánh giá và triển khai Claude 3.5 Sonnet: Hiệu suất vượt trội và bảo mật dữ liệu

(giờ Việt Nam)

Tóm tắt AI

CTO JetBrains tiết lộ quy trình kiểm thử mô hình trên kho lưu trữ nội bộ, cho thấy Claude 3.5 Sonnet đạt tỷ lệ giải mã Python 44,3% và tối ưu hóa quy trình làm việc hiệu quả hơn đáng kể so với các phiên bản trước.

Bản dịch AI

Securing the frontier: How JetBrains evaluates and deploys Claude Fable 5

JetBrains xây dựng các công cụ được các lập trình viên trên toàn thế giới sử dụng, từ IntelliJ IDEA và PyCharm cho đến ngôn ngữ lập trình Kotlin, phục vụ hơn 12,5 triệu người dùng hoạt động và 88 trong số 100 công ty thuộc danh sách Fortune Global 100. Vladislav Tankov, CTO tại JetBrains, đã chia sẻ với Anthropic về cách đội ngũ của ông đánh giá các mô hình mới, quyết định thời điểm sử dụng Claude Fable 5, cũng như suy nghĩ về việc lưu giữ dữ liệu và các biện pháp bảo vệ khi làm việc với các mô hình tiên phong (frontier models).

AI tiên phong đã thay đổi như thế nào đối với JetBrains trong năm 2026?

Tôi đã gắn bó với JetBrains được 10 năm và chúng tôi là một trong những khách hàng đầu tiên của các nhà cung cấp LLM. Trong năm qua, chúng tôi đã chuyển từ trạng thái có những người hoài nghi về AI trong số khách hàng và nội bộ công ty sang việc nhận thấy rằng AI là một phần tất yếu. Đây là một thay đổi lớn và mang tính nền tảng trong ngành công nghệ. Thực sự, mọi người hoài nghi trong công ty đều đã thay đổi quan điểm.

Ông đánh giá các mô hình mới như thế nào và quyết định khi nào nên sử dụng chúng?

Chúng tôi là một công ty chuyên về lập trình, vì vậy chúng tôi có một quy trình đánh giá (evaluation pipeline) lớn: các bộ đánh giá quy mô trên các kho lưu trữ riêng tư, bao gồm cả monorepo của chúng tôi. Chúng tôi xem xét kỹ lưỡng liệu một mô hình có thực sự đạt được điểm số benchmark trong công việc thực tế hay không—một số mô hình được tinh chỉnh để đạt điểm cao trên các benchmark công khai nhưng lại thất bại ở các tác vụ thực tế. Với một kho lưu trữ riêng tư, việc kiểm tra điều đó dễ dàng hơn nhiều. Chúng tôi cũng duy trì các bảng xếp hạng về chất lượng tốt nhất, chi phí mỗi tác vụ tốt nhất và mô hình nhanh nhất. Mặc dù Claude Fable 5 đắt hơn tính trên mỗi token, nhưng chi phí trên mỗi tác vụ lại thấp hơn trong một số trường hợp, đặc biệt là đối với các công việc phức tạp và kéo dài.

Claude Fable 5 đạt điểm số như thế nào trong các bài đánh giá của ông so với các mô hình trước đó?

Claude Fable 5 vừa chính xác hơn vừa hiệu quả hơn các mô hình trước đây. Nó đạt tỷ lệ vượt qua (pass rate) Python tốt nhất trong bộ công cụ của chúng tôi với 44,3%, so với 28,2% của Opus 4.8, một bước nhảy vọt 16 điểm. Trong một so sánh đối đầu trực tiếp, Claude Fable 5 đã giải quyết được 18 tác vụ Python mà Opus 4.8 bỏ lỡ và chỉ thất bại 2 tác vụ. Các câu trả lời của nó cũng đáng tin cậy hơn: khi chạy mã, nó vượt qua các bài kiểm tra của chúng tôi thường xuyên hơn nhiều so với bất kỳ mô hình Opus nào. Điều đó rất quan trọng vì mã chạy được nhưng tạo ra kết quả sai là loại lỗi tốn kém nhất để phát hiện.

Câu chuyện về hiệu suất cũng thú vị không kém. Claude Fable 5 cần ít hơn khoảng 22% số bước so với Opus 4.8 để đạt được giải pháp, vì vậy nó tạo ra mã nguồn hoạt động với ít thử sai hơn. Nó cũng tập trung nỗ lực vào đúng chỗ. Đối với các tác vụ Java, Opus 4.8 liên tục cố gắng kéo các tài nguyên bên ngoài vào, thứ mà hầu như không bao giờ giúp ích trong môi trường của chúng tôi, trong khi Claude Fable 5 bỏ qua hoàn toàn điều đó và làm việc với mã nguồn ngay trước mắt. Nó cho thấy những thói quen kỹ thuật tốt hơn một cách tổng thể.

Khi nào ông sử dụng Claude Fable 5 thay vì các mô hình khác?

Opus được xem như một "cỗ máy làm việc": bạn có thể rất tin tưởng rằng nó sẽ hoàn thành công việc. Bạn tìm đến Claude Fable 5 khi thực sự cần khả năng suy luận tốt, khi bạn gần như cần một cộng sự và chính bạn cũng không chắc chắn cách thực hiện công việc đó như thế nào. Ví dụ, một trong những trưởng nhóm kỹ thuật của chúng tôi đã quyết định triển khai một thành phần trình soạn thảo văn bản đa dạng thức (rich text editor) mà chúng tôi đã thử vài lần trong những năm qua, và Claude Fable 5 đã hoàn thành nó gần như ngay lập tức.

Một trường hợp sử dụng Claude Fable 5 phổ biến khác là thử nghiệm lập trình tác tử (agentic-coding) kéo dài. Chúng tôi cung cấp cho một tác tử chạy Claude Fable 5 các thông số kỹ thuật (dưới dạng văn bản và hình ảnh) và yêu cầu nó triển khai các ứng dụng phức tạp giống như IDE. Điều thú vị ở đây là các thông số kỹ thuật cũng có thể được tạo ra bởi chính tác tử đó, dựa trên ứng dụng hiện có. Việc kết hợp hai thành phần này cho phép chúng tôi viết lại ứng dụng từ runtime, framework hoặc ngôn ngữ này sang ngôn ngữ khác trong một thiết lập gần như là "hộp đen".

Ông suy nghĩ thế nào về vấn đề an toàn và lưu giữ dữ liệu với các mô hình tiên phong hiện nay?

Chúng tôi không phải là một công ty cố gắng tự tạo ra mô hình an toàn nhất. Chúng tôi kỳ vọng rằng việc red teaming và mọi thứ khác được thực hiện từ phía Anthropic là đủ để tin rằng mô hình đó an toàn. Sau đó, chúng tôi áp dụng cách tiếp cận có hệ thống đối với việc triển khai, nơi chúng tôi có thể đảm bảo an toàn: tạo ra cơ sở hạ tầng và lưới an toàn xung quanh mô hình và bộ khung (harness), thay vì tinh chỉnh chính mô hình đó.

Bảo mật cũng là một trong những mục đích sử dụng Claude Fable 5 lớn nhất của chúng tôi. Chúng tôi chạy kiểm thử hộp trắng (white-box testing) đối với các sản phẩm của chính mình để tìm lỗ hổng, và đội ngũ bảo mật của chúng tôi đang chuẩn bị cho thực tế rằng không chỉ chúng tôi đang chạy mô hình này—mà những người bên ngoài công ty cũng sẽ chạy Claude Fable 5, hoặc các mô hình cùng đẳng cấp, để dò tìm lỗ hổng trên tất cả các sản phẩm của chúng tôi. Vì chúng tôi phục vụ các doanh nghiệp lớn trong các ngành được quản lý chặt chẽ, việc chuẩn bị là rất quan trọng. Claude Fable 5 hỗ trợ công việc của chúng tôi thay vì gây cản trở.

Vì vậy, đó là một sự cân bằng chặt chẽ: bộ phân loại (classifier) ở phía các bạn càng ít quyết liệt, thì ai đó sẽ càng tìm thấy nhiều lỗ hổng trong sản phẩm của chúng tôi—bao gồm cả những lỗ hổng mà chưa ai biết đến.

Và cũng không có gì bí mật: chúng tôi muốn việc lưu giữ dữ liệu bằng không. Nhưng tôi không thấy cách nào khác để các bạn hiểu được những gì đã được yêu cầu và nơi mà bộ phân loại có thể đã hoạt động không chính xác. Miễn là việc xem xét chỉ nhằm điều tra các trường hợp nghiêm trọng nhất được gắn cờ, tôi thấy ổn với điều đó. Tôi nghĩ đó là một sự đánh đổi công bằng để có quyền truy cập vào trí tuệ tiên phong, cho phép đội ngũ của tôi thực hiện công việc tốt nhất của họ.

Điều gì tiếp theo trong lộ trình AI của JetBrains?

Chúng tôi kỳ vọng các mô hình nền tảng do các nhà cung cấp LLM xây dựng sẽ ngày càng có năng lực hơn. Điều quan trọng bây giờ là một loại "buồng lái" (cockpit) cho phát triển phần mềm: một không gian nơi các tác tử và con người cộng tác, và nơi con người có thể quản lý quy trình phát triển.

Đối với JetBrains, đây là một sự chuyển đổi lớn. Chúng tôi thấy cơ hội để xây dựng thế hệ sản phẩm tiếp theo xuyên suốt vòng đời phát triển phần mềm tác tử (agentic software development lifecycle) để vận hành buồng lái đó. Các lập trình viên sẽ nhận được nhiều mã nguồn tốt hơn được chuyển giao bởi các tác tử, các vai trò phi kỹ thuật sẽ đóng vai trò lớn hơn trong việc tạo ra phần mềm, và các tổ chức sẽ có được sự quản trị và sự rõ ràng về lợi tức đầu tư mà họ cần.

Bắt đầu với Claude Fable ngay hôm nay.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Claude: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.