Tin ngành
a16z rót vốn vào Vals: Xây dựng 'lớp tin cậy' cho đánh giá AI thực tế
(giờ Việt Nam)
Tóm tắt AI
a16z đầu tư vào Vals, nền tảng thay thế các bài kiểm tra học thuật lỗi thời bằng hệ thống đánh giá tự động dựa trên quy trình làm việc thực tế, giúp đo lường chính xác hiệu suất AI trong môi trường doanh nghiệp.
Bản dịch AI


Mỹ | Công nghệ | Ý kiến | Văn hóa | Biểu đồ

Chúng ta đều biết AI đang ngày càng thông minh hơn mỗi ngày. Đối với đa số người dùng, hiện nay có một câu hỏi quan trọng hơn: liệu nó có đang làm tốt hơn những việc tôi cần nó thực hiện hay không?
Trong nhiều năm, ngành công nghiệp đã dựa vào các tiêu chuẩn học thuật (academic benchmarks) để theo dõi sự tiến bộ của các mô hình. Chúng cung cấp một ngôn ngữ chung để so sánh các mô hình và trong một thời gian, đây là thước đo hữu ích nhất cho năng lực của AI.
Tuy nhiên, các mô hình tiên phong (frontier models) ngày càng đạt điểm tối đa trong cùng những bài kiểm tra đó. Các tập dữ liệu công khai dần trở nên bão hòa, bị rò rỉ vào kho dữ liệu huấn luyện, hoặc trở thành mục tiêu mà các mô hình được tối ưu hóa một cách rõ ràng để vượt qua. Một mô hình có thể trông rất xuất sắc trên bảng xếp hạng nhưng vẫn gặp khó khăn khi được yêu cầu thực hiện những công việc phức tạp, đa bước vốn thực sự quan trọng trong thế giới thực.
Đồng thời, rủi ro cũng ngày càng cao. Các mô hình đang chuyển từ việc "trả lời câu hỏi" sang "thực hiện công việc": phân tích tài liệu tài chính, giải quyết các vụ việc pháp lý, viết và gỡ lỗi phần mềm, điều hướng các quy trình doanh nghiệp phức tạp. Tầm nhìn của các tác vụ này cũng đang dài hơn: các tác nhân (agents) đang hoạt động tự chủ trong nhiều giờ và nhiều ngày. Việc chọn sai mô hình cho một tác vụ có thể gây tốn kém không chỉ hàng ngàn đô la tiền token, mà còn cả thời gian và sự hài lòng của khách hàng.
Đó là lý do Vals ra đời: xây dựng lớp tin cậy giữa các mô hình và những người dựa vào chúng.
Vals áp dụng một cách tiếp cận hoàn toàn khác biệt đối với việc đánh giá: kiểm tra các mô hình dựa trên công việc mà con người thực sự muốn chúng thực hiện, thay vì các bài kiểm tra được dàn dựng. Đội ngũ làm việc với các chuyên gia trong nhiều lĩnh vực khác nhau để biến các quy trình làm việc thực tế thành các tiêu chuẩn khắt khe, sau đó xây dựng các hệ thống chấm điểm tự động có thể đánh giá sản phẩm cuối cùng theo tiêu chuẩn chuyên gia. Thay vì hỏi liệu một mô hình pháp lý có thể vượt qua kỳ thi luật sư hay không, Vals kiểm tra xem nó có thể thực hiện nghiên cứu pháp lý hay không; trong lĩnh vực tài chính, liệu nó có thể phân tích các tài liệu phức tạp hay không; trong lập trình, liệu nó có thể xây dựng một ứng dụng hoạt động được hay không.
Quan trọng không kém, Vals đã xây dựng cơ sở hạ tầng để thực hiện các đánh giá này một cách nhanh chóng, có thể tái lập và bảo mật ở quy mô lớn. Các bộ kiểm tra riêng tư được giữ kín và có số lần chạy hạn chế để tránh tình trạng rò rỉ dữ liệu và gian lận, trong khi hệ thống đánh giá của Vals có thể đưa ra kết quả chuẩn hóa chỉ trong vài giờ sau khi nhận quyền truy cập mô hình. Kết quả là một hệ thống chấm điểm vừa gần với công việc kinh tế thực tế, vừa đủ thiết thực để bắt kịp với tốc độ ra mắt của các mô hình tiên phong.
Vals hiểu rằng các tiêu chuẩn đánh giá có tính chất tạm thời và thích ứng. Một tiêu chuẩn tốt được cho là sẽ trở nên lỗi thời. Nếu các mô hình đã cải thiện đến mức mọi hệ thống đều đạt điểm gần như tuyệt đối (cái gọi là "benchmaxing"), thì tiêu chuẩn đó đã hoàn thành nhiệm vụ của mình và đã đến lúc xây dựng một tiêu chuẩn khó hơn. Vals đã và đang loại bỏ các đánh giá đã bão hòa và liên tục giới thiệu các tác vụ mới khi ranh giới công nghệ thay đổi. Ví dụ, vào tháng 5, đội ngũ đã thay thế CorpFin bằng Excel Modelling Benchmark mới sau khi CorpFin không còn cung cấp đủ sự khác biệt giữa các mô hình.
Chúng tôi tin rằng khả năng liên tục xác định ranh giới công nghệ này là điều mà ngành công nghiệp cần để bắt kịp và đưa ra các quyết định thông minh, sáng suốt khi áp dụng AI.
Mọi thị trường cuối cùng đều cần một đơn vị chấm điểm độc lập. Khi các nhà cung cấp tự chấm điểm bài làm của chính mình, người mua cần một bên mà họ có thể tin tưởng. Thị trường tín dụng đã phát triển Moody’s và S&P; thị trường đại chúng dựa vào các kiểm toán viên độc lập; các nhà sản xuất sản phẩm dựa vào UL để chứng nhận an toàn. Những tổ chức này xuất hiện vì cùng một lý do: khi người bán có nhiều thông tin hơn người mua - và có mọi động lực để thể hiện bản thân một cách thuận lợi nhất - thì việc đo lường bởi bên thứ ba đáng tin cậy sẽ giúp thị trường vận hành tốt hơn. Đó là vị thế của chúng ta với AI, lĩnh vực đang phát triển thành một trong những thị trường lớn nhất trong ngành. Cơ hội và trách nhiệm là vô cùng to lớn.
Rayan Krishnan và Langston Nashold đã vô cùng kiên trì và thấu đáo về vấn đề này ngay từ đầu. Việc xây dựng đơn vị chấm điểm độc lập cho AI đòi hỏi một sự kết hợp hiếm có: chiều sâu kỹ thuật, sự hoài nghi và lòng kiên nhẫn để liên tục xây dựng lại các bài kiểm tra khi ranh giới công nghệ thay đổi. Rayan và Langston hội tụ cả ba yếu tố đó. Tại Stanford, cả hai nhà đồng sáng lập đều học khoa học máy tính và đã cộng tác về các vấn đề đo lường trong thế giới thực nhiều năm trước khi bắt đầu Vals. Điều đó khiến họ trở nên phù hợp một cách độc đáo, không chỉ để xuất bản thêm một bảng xếp hạng khác, mà còn để xây dựng lớp đánh giá thích ứng, đáng tin cậy mà thị trường AI sẽ phụ thuộc vào.
Chúng tôi rất vui mừng được hợp tác với Rayan, Langston và toàn bộ đội ngũ Vals khi họ xây dựng lớp tin cậy làm nền tảng cho nền kinh tế AI.

Bản tin này chỉ được cung cấp cho mục đích thông tin và không nên được coi là lời khuyên về pháp lý, kinh doanh, đầu tư hoặc thuế. Hơn nữa, nội dung này không phải là lời khuyên đầu tư, cũng không nhằm mục đích sử dụng bởi bất kỳ nhà đầu tư hoặc nhà đầu tư tiềm năng nào trong bất kỳ quỹ nào của a16z. Bản tin này có thể liên kết đến các trang web khác hoặc chứa thông tin khác thu được từ các nguồn bên thứ ba - a16z chưa xác minh độc lập cũng như không đưa ra bất kỳ tuyên bố nào về tính chính xác hiện tại hoặc lâu dài của thông tin đó. Nếu nội dung này bao gồm quảng cáo của bên thứ ba, a16z chưa xem xét các quảng cáo đó và không xác nhận bất kỳ nội dung quảng cáo hoặc công ty liên quan nào trong đó. Bất kỳ khoản đầu tư hoặc công ty danh mục đầu tư nào được đề cập, tham chiếu hoặc mô tả đều không đại diện cho tất cả các khoản đầu tư trong các phương tiện do a16z quản lý; truy cập https://a16z.com/investment-list/ để xem danh sách đầy đủ các khoản đầu tư. Thông tin quan trọng khác có thể được tìm thấy tại a16z.com/disclosures. Bạn nhận được bản tin này vì bạn đã chọn đăng ký trước đó; nếu bạn muốn từ chối nhận các bản tin trong tương lai, bạn có thể hủy đăng ký ngay lập tức.
Không có bài đăng nào.
Bài viết được AI dịch và tổng hợp tự động từ a16z: News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.