Tin ngành
Balyasny Asset Management ứng dụng Claude Fable 5: Đột phá trong tự động hóa tài chính
(giờ Việt Nam)
Tóm tắt AI
Balyasny Asset Management đạt tỷ lệ chính xác 89,4% trong các tác vụ tài chính phức tạp nhờ Claude Fable 5. Nền tảng BAMAgent của họ hiện vận hành hàng nghìn tác nhân AI tự chủ 24/7, đưa mô hình này trở thành lựa chọn ưu tiên cho phân tích và lập kế hoạch.
Bản dịch AI

Balyasny Asset Management (BAM) là một công ty đầu tư đa chiến lược toàn cầu, quản lý khoảng 38 tỷ USD tài sản và hỗ trợ đội ngũ gồm khoảng 2.000 chuyên gia đầu tư cùng nhân viên. Charlie Flanagan, Giám đốc AI (Chief AI Officer), đã có cuộc trao đổi với Anthropic về cách công ty đánh giá các mô hình mới trên hàng nghìn tác vụ tài chính thực tế, lý do tại sao họ xây dựng nền tảng riêng để vận hành các tác nhân (agent), và những thay đổi sau khi ra mắt Claude Fable 5.
AI tiên phong (frontier AI) đã thay đổi như thế nào đối với BAM trong năm 2026?
2026 là năm chúng tôi chuyển dịch từ các hệ thống AI chỉ biết tìm kiếm sang các hệ thống AI biết thực hiện công việc.
Thay đổi then chốt không chỉ nằm ở các mô hình, mà còn ở các hệ thống hỗ trợ (harnesses) xung quanh chúng, chẳng hạn như Claude Code. Chúng cho phép các giải pháp AI mà chúng tôi xây dựng đảm nhận những tác vụ phức tạp hơn nhiều và kéo dài hơn. Khả năng cung cấp cho AI một kết quả đầu ra mong muốn thay vì chỉ đưa ra câu lệnh (prompt), và để nó tiếp tục làm việc cho đến khi hoàn thành, thực sự là một bước ngoặt.
Một ví dụ thực tế là phân tích kinh doanh chênh lệch giá trong sáp nhập (merger-arbitrage analysis). Khi một thương vụ được công bố, các tác nhân hiện sẽ xây dựng gói phân tích thương vụ ban đầu. Chúng ước tính khả năng thương vụ thành công và thời gian thực hiện, trích xuất các điều khoản kinh tế và pháp lý chính, xác định các điều kiện và cột mốc quan trọng, đồng thời gắn cờ các khu vực cần sự đánh giá từ nhà đầu tư.
Một năm trước, các bước đó còn rời rạc giữa việc nghiên cứu thủ công và các công cụ riêng lẻ; chúng tôi không có tác nhân nào có thể duy trì đáng tin cậy toàn bộ quy trình làm việc nhiều bước để đi đến một kết luận hữu ích. Công việc đó từng mất từ ba đến năm ngày. Hiện nay, nó mất chưa đầy một ngày. Tác nhân chạy trong khoảng 30 phút, với sự xem xét của con người trước khi bất kỳ kết quả đầu ra quan trọng nào được đưa vào sử dụng.
Chúng tôi sử dụng các mô hình tiên phong của Anthropic, nhưng phần lớn cơ sở hạ tầng được xây dựng nội bộ tại BAM, bao gồm hệ thống thực thi, quyền truy cập dữ liệu và các kiểm soát đánh giá.
Ông đã đánh giá Claude Fable 5 như thế nào trước khi đưa vào sử dụng?
Một điều chúng tôi đã làm từ nhiều năm trước và mang lại hiệu quả cực kỳ tốt là đầu tư vào các hệ thống đánh giá mạnh mẽ. Chúng tôi kiểm tra các mô hình mới trên hàng nghìn tác vụ tài chính thực tế với kết quả có thể kiểm chứng, bao gồm cổ phiếu, kinh tế vĩ mô và hàng hóa, thay vì chỉ dựa vào các tiêu chuẩn đánh giá chung hay các bản demo đơn lẻ. Điều này cho phép chúng tôi đưa ra các quyết định dựa trên dữ liệu về việc lựa chọn và điều hướng mô hình, và tôi nghĩ đây là điều mà mọi doanh nghiệp nên đầu tư.
Chúng tôi kiểm tra cả mô hình độc lập và hiệu suất của nó trong môi trường tác nhân (agentic environment) của chúng tôi, với cùng các công cụ, tệp tin và yêu cầu mà người dùng của chúng tôi có. Liệu nó có thể lập kế hoạch công việc, chọn và sử dụng đúng công cụ, tìm kiếm và phân tích bằng chứng, phục hồi sau lỗi, kiểm tra kết quả trung gian và tạo ra một sản phẩm bàn giao có căn cứ không? Chúng tôi cũng tìm kiếm các kiểu lỗi cụ thể, như lỗi số học, thiếu phạm vi bao phủ, kết luận không có căn cứ và các vấn đề về truy xuất dữ liệu.
Trên tập hợp con liên quan, Fable đạt 89,4% so với 86,1% của mô hình sản xuất trước đó, trên hàng nghìn tác vụ. Điểm nổi bật nhất của nó là khả năng lập kế hoạch phức tạp, phân tích và thực thi tác nhân.
Kết quả đáng ngạc nhiên là một loạt các bài toán kinh tế mà chúng tôi đã kiểm tra, vốn chưa từng có mô hình nào hoàn thành thành công cho đến khi có Fable. Ban đầu, chúng tôi coi kết quả này là một vấn đề tiềm ẩn trong khâu đánh giá vì nó đại diện cho một bước tiến đáng kể so với mọi mô hình chúng tôi từng thử nghiệm. Chúng tôi đã chạy lại đánh giá, kiểm tra độc lập tác vụ và logic chấm điểm, đồng thời xem xét kết quả với Anthropic trước khi kết luận rằng sự cải thiện này là có thật. Đó là một khoảnh khắc đầy kinh ngạc.
Ngày nay, các đội ngũ đầu tư của chúng tôi sử dụng Fable làm mô hình tiên phong ưu tiên cho công việc hệ thống và lập trình. Chúng tôi đưa ra hướng dẫn cho họ về thời điểm sử dụng Fable so với các mô hình khác, dựa trên hiệu quả và chi phí.
Ông nghĩ thế nào về vấn đề an toàn với các mô hình tiên phong hiện nay?
Chúng tôi coi an toàn là một vấn đề về sản phẩm và mô hình vận hành, chứ không phải là một bài tập lựa chọn mô hình một lần. Các câu hỏi liên quan không chỉ là mô hình có thể làm gì, mà là nó có thể truy cập dữ liệu nào, sử dụng công cụ gì, thực hiện hành động nào, những gì bắt buộc phải có sự phê duyệt của con người, và làm thế nào để chúng tôi biết khi có sự cố xảy ra.
Điều đó có nghĩa là đặt các kiểm soát xung quanh mô hình thay vì giả định rằng bản thân mô hình là sự kiểm soát. Chúng tôi sử dụng các ranh giới dữ liệu được phê duyệt, quyền truy cập tối thiểu (least-privilege access), quyền cấp độ công cụ, ghi nhật ký và khả năng truy xuất nguồn gốc, sự xem xét của con người đối với các đầu ra quan trọng, và các lộ trình leo thang rõ ràng cho các trường hợp ngoại lệ. Chúng tôi cũng kiểm tra các kịch bản đối nghịch và lỗi trước khi mở rộng quyền truy cập.
Những kiểm soát đó là ưu tiên ngay từ ngày đầu, và bảo mật không thay đổi về cơ bản với Fable. Một mô hình có năng lực hơn không nhận được thẩm quyền rộng hơn chỉ vì nó có thể suy luận hoặc lập kế hoạch hiệu quả hơn. Các mô hình chỉ có thể sử dụng các công cụ và nguồn dữ liệu được phê duyệt cho người dùng và tác vụ đó, và chúng không thể tự cấp thêm quyền truy cập cho chính mình. Sự đánh giá và trách nhiệm đầu tư vẫn thuộc về con người.
BAMAgent đóng vai trò gì trong hệ thống này?
Nhìn về tương lai, xu hướng là hướng tới các tác nhân có năng lực hơn, có thể thực hiện các hành động nhiều bước, kéo dài. Điều đó làm cho công tác quản trị trở nên quan trọng hơn bao giờ hết. Đối với chúng tôi, điều đó có nghĩa là xây dựng BAMAgent, nền tảng nội bộ để triển khai các tác nhân một cách an toàn vào các quy trình doanh nghiệp đã được phê duyệt. Nó cung cấp cho các tác nhân các công cụ và hệ thống cần thiết, nhưng chỉ đúng những công cụ và hệ thống đó. Chúng tôi đã xây dựng nó được sáu tháng và hiện nó hỗ trợ hàng nghìn tác nhân tự hành làm việc 24/7.
BAMAgent là bước tiến tiếp theo vượt ra ngoài nền tảng trò chuyện (chat) của chúng tôi. Chat giúp con người tiếp nhận và tổng hợp thông tin. BAMAgent thực hiện công việc: nghiên cứu và phân tích nhiều bước có thể chạy trong nhiều giờ hoặc nhiều ngày, với các tác nhân làm việc song song, và kết thúc bằng một kết quả mà con người có thể xem xét. Nó có thể xây dựng và duy trì một gói nghiên cứu công ty, chuẩn bị cho một sự kiện thu nhập hoặc kinh tế vĩ mô, hoặc biến các bằng chứng mới thành các kịch bản tài chính. Tác nhân lập kế hoạch công việc, sử dụng các hệ thống nội bộ được phê duyệt, chạy phân tích, kiểm tra các kết quả trung gian và trả về một sản phẩm nghiên cứu, mô hình hoặc gói hỗ trợ quyết định.
Fable là mô hình ưu tiên của chúng tôi cho các giai đoạn lập kế hoạch và phân tích. Một sai sót ở đó sẽ ảnh hưởng đến mọi kết quả bàn giao tiếp theo, vì vậy chúng tôi muốn mô hình mạnh nhất hiện có quyết định cách chia nhỏ vấn đề, bằng chứng nào là quan trọng và cách hòa giải các tín hiệu mâu thuẫn. Đó là điều cho phép tác nhân làm việc như một đồng nghiệp có năng lực.
Mọi doanh nghiệp nên phát triển chiến lược để hướng tới mô hình tác nhân được lưu trữ (hosted-agent model), cho phép quản lý và thực thi cấp doanh nghiệp trong khi tối đa hóa tiện ích của các tác nhân cho người dùng.
Claude Fable 5 đã tạo ra những khả năng gì cho BAM?
Phản ứng nhận lại là vô cùng tích cực. Cuối cùng, mọi người quan tâm đến những gì công nghệ này có thể mở khóa trong công việc hàng ngày của họ.
Trong một ví dụ, một BAMAgent đã chạy phân tích thu hoạch lỗ thuế (tax-loss harvesting). Nó đã khám phá 90.000 bảng dữ liệu, tìm thấy dữ liệu nắm giữ quỹ tương hỗ liên quan và tự xây dựng hệ thống trọng số riêng. Sau khi được đội ngũ của chúng tôi xem xét, kết quả thu được toàn diện hơn so với những gì một phương pháp truyền thống có thể tạo ra.
Ngoài ra, Chuyên gia kinh tế trưởng của chúng tôi đã cấu hình một quy trình tác nhân giúp giảm thời gian phân tích ngân hàng trung ương định kỳ từ khoảng hai ngày xuống còn khoảng 30 phút, trong khi chuyên gia kinh tế vẫn giữ quyền xem xét và đánh giá.
Fable đóng góp khả năng suy luận, tổng hợp và giải quyết vấn đề nhiều bước. Hệ thống hỗ trợ của BAM cung cấp thiết kế quy trình, quyền truy cập dữ liệu và công cụ được phê duyệt, ngữ cảnh truy xuất, quyền hạn, giám sát và các kiểm soát xem xét của con người. Cả hai đều cần thiết để có được kết quả chất lượng sản xuất.
Khi các mô hình ngày càng trở nên mạnh mẽ hơn, bước tiếp theo trong lộ trình AI của ông là gì?
Đây là năm chúng ta chuyển từ việc con người có công cụ sang việc có đồng đội. Giống như một đồng đội, các tác nhân sẽ trở nên hữu ích hơn theo thời gian khi bạn làm việc với chúng, hoàn thành các tác vụ phức tạp hơn và bắt đầu chủ động thực hiện công việc để hỗ trợ.
Chúng tôi đã có một số đội ngũ vận hành hơn 300 tác nhân liên tục thực hiện phân tích trên dữ liệu và thông tin mới. Điều này giúp các đội ngũ vừa nhanh chóng có được thông tin chi tiết, vừa không bỏ sót bất cứ điều gì.
Nó cũng thay đổi câu hỏi mà chúng tôi đặt ra. Chúng tôi từng xây dựng các hệ thống chuyên gia và dạy mọi người tự động hóa các quy trình họ đã có. Bây giờ, chúng tôi tự hỏi liệu có cách nào tốt hơn để đạt được kết quả hay không.
Những giới hạn thực sự chỉ nằm ở trí tưởng tượng của chính chúng ta. Các công cụ, dữ liệu và mô hình hiện đã đạt đến điểm có thể thực hiện công việc thực tế trong nhiều giờ liền; việc của chúng ta là tiếp tục tái hình dung những gì có thể đạt được. 12 tháng tới sẽ là một khoảng thời gian vô cùng thú vị.
Bắt đầu với Claude Fable.
Bài viết được AI dịch và tổng hợp tự động từ Claude: Blog (Web). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.