Mô hình
Desert Ant Labs ra mắt 18 mô hình AI chuyên biệt chạy trực tiếp trên thiết bị
(giờ Việt Nam)
Tóm tắt AI
Desert Ant Labs vừa công bố 18 mô hình AI nhỏ gọn cho thiết bị di động, hỗ trợ xử lý âm thanh, hình ảnh và văn bản thông qua bộ SDK thống nhất trên Swift, Kotlin và JavaScript.
Bản dịch AI

Hôm nay, chúng tôi ra mắt Desert Ant Labs, một phòng thí nghiệm AI tiên phong tại châu Âu chuyên xây dựng trí tuệ nhân tạo trên thiết bị (on-device) với quan điểm rõ ràng. Chúng tôi tin rằng con đường tốt nhất để đạt được trí tuệ hiệu quả bắt đầu từ chính thiết bị.
Chúng tôi đang xây dựng các mô hình nhỏ, chuyên biệt cho âm thanh, hình ảnh và văn bản – mỗi mô hình phản hồi trong vài mili giây và không tốn chi phí vận hành, vì vậy bạn có thể đưa trí tuệ vào mọi tương tác sản phẩm mà không bị giới hạn bởi chi phí token hay tốc độ suy luận. Đủ nhỏ để chạy trên một chiếc điện thoại năm năm tuổi, đủ nhanh để sử dụng trên từng khung hình hoặc thao tác phím, và tốt hơn cả các API mà bạn đang phải trả phí.
18 mô hình đầu tiên đã chính thức ra mắt hôm nay (12 mô hình ổn định và 6 mô hình bản beta), có thể truy cập thông qua một SDK duy nhất cho Swift, Kotlin và JavaScript. Mỗi mô hình cho một tác vụ, được xây dựng để trở thành cách nhanh nhất nhằm hoàn thành tác vụ đó ngay trên thiết bị:
Tongue · 2MB 0.933
293MB detector 0.887
Và đó chỉ là một vài ví dụ. Bạn có thể tìm thấy thông số kỹ thuật đầy đủ và các bài kiểm tra hiệu năng (benchmark) cho 14 mô hình còn lại tại desertant.com/models và Hugging Face. Mọi mô hình đều miễn phí cho tối đa 100.000 thiết bị hoạt động hàng tháng. Không token, không đăng nhập.
Redact · 12MB 88.8
GLiNER-PII · 2.3GB 91.1
Rampart · 14.7MB 61.4
OpenAI filter · 3GB 60.2
Chúng tôi xây dựng điều này tại châu Âu, nơi "on-device" là tiêu chuẩn mặc định về chủ quyền dữ liệu. Dữ liệu không bao giờ rời khỏi tay khách hàng của bạn, tính năng không bao giờ phụ thuộc vào đám mây của bên thứ ba, và những gì chưa từng được tải lên thì không bao giờ có thể bị cưỡng ép truy cập.
Chúng tôi đã bắt đầu như thế nào
Trong năm năm qua, chúng tôi đã xây dựng ứng dụng video của mình, Detail, với phương pháp ưu tiên chạy trên thiết bị. Nhưng khi giới thiệu các tính năng như Auto Edit để tạo clip ngắn, hay tăng cường âm thanh cho podcast, chúng tôi buộc phải quay lại sử dụng các API đám mây. Và khi Detail ngày càng phổ biến, hóa đơn cơ sở hạ tầng của chúng tôi cũng tăng theo.
Cứ vài tháng, tôi lại tìm kiếm các mô hình on-device hữu ích. Tôi lướt Hugging Face để tìm một mô hình có thể phát hiện các từ đệm hoặc làm sạch bản ghi âm. Và mỗi tháng Sáu, chúng tôi lại có những công cụ mới tuyệt vời để xây dựng, nhưng ngành công nghiệp này không chuyển động đủ nhanh. Nền tảng đã có sẵn: chip, Core ML, các nghiên cứu. Điều còn thiếu là mọi thứ nằm giữa nền tảng đó và việc thực sự triển khai một tính năng vào ứng dụng của bạn: một mô hình mà bạn có thể "thả" vào và phát hành chỉ với vài dòng mã.
Vì vậy, chúng tôi tự huấn luyện các mô hình. Hóa ra việc huấn luyện một mô hình là một thách thức về thiết kế sản phẩm, và sản phẩm chính là thế mạnh của chúng tôi. Chúng tôi đã thiết kế các mô hình và khả năng suy luận cục bộ vượt trội hơn các dịch vụ đám mây về tốc độ, chất lượng và chi phí, đồng thời đánh bại các mô hình cục bộ và đám mây khác trong chính tác vụ đó, với kích thước chỉ bằng một phần nhỏ.
Chúng tôi đã thay thế Dolby bằng Clear để có khả năng tăng cường âm thanh tốt hơn, nhanh hơn, và giúp các bản ghi âm trên thiết bị của chúng tôi nhanh gấp 5 lần với Voz. Chúng tôi cũng thay thế Claude Sonnet bằng Clips, mô hình 284MB của chúng tôi, giúp biến một video 10 phút thành hàng chục clip chỉ trong 5 giây – nhanh gấp 10 lần và tiêu thụ ít năng lượng hơn 470 lần so với Sonnet, với cùng chất lượng.
iPhone 16 Pro 302x
MacBook Pro (M5) 345x
Voz 319x
Apple SpeechAnalyzer 78x
Whisper large-v3-turbo 50x
Detail 6, phiên bản sẽ ra mắt cùng với iOS 27, thay thế tất cả các API đám mây của chúng tôi bằng các mô hình tự phát triển, chạy hoàn toàn trên thiết bị.
Tất cả chúng ta đã dành vài năm qua để xây dựng với các LLM như thể chúng chỉ là một API khác. Và giữa sự cường điệu xung quanh các bộ não AI tổng quát tiên phong, chúng ta gần như quên mất rằng chúng không phải là lựa chọn duy nhất.
Mọi nhà phát triển tôi trò chuyện đều có một danh sách mong muốn về các mô hình on-device mà họ sẽ xây dựng nếu chi phí không phải là vấn đề, hoặc một tính năng mà họ đang tốn kém quá nhiều token và sẵn sàng thay thế bằng một mô hình cục bộ. Một lệnh gọi chạy theo cùng một cách hàng trăm nghìn lần mỗi ngày: làm sạch bản ghi âm, gắn thẻ ảnh, trích xuất ngày tháng từ một câu, bắt lấy một cái tên trước khi văn bản chạm đến máy chủ của bạn. Không cái nào trong số này cần đến một mô hình tiên phong (frontier model).
Các nhà nghiên cứu của NVIDIA đã phân tích ba hệ thống tác nhân (agent systems) và ước tính rằng 40 đến 70% các lệnh gọi đến một mô hình lớn có thể được chuyển sang một mô hình nhỏ, chuyên biệt thay thế.
Khả năng tính toán đã được chi trả
Ngành công nghiệp này sẽ chi khoảng 450 tỷ USD cho các trung tâm dữ liệu trong năm nay. Trong khi đó, thế giới xuất xưởng hơn một tỷ điện thoại, máy tính bảng và máy tính xách tay với các con chip ngày càng mạnh mẽ, hoàn toàn phù hợp cho những tác vụ kiểu này. Có nhiều khả năng tính toán nằm trong tay người dùng hơn là trong tất cả các trung tâm dữ liệu AI trên trái đất cộng lại.
Chúng tôi có lợi thế cạnh tranh không công bằng với khả năng suy luận miễn phí. Không tốn phí mỗi lần gọi, vì vậy một tính năng có thể chạy trên mọi tin nhắn thay vì chỉ những tin nhắn bạn đủ khả năng kiểm tra. Không có độ trễ truyền tải (round-trip), và dữ liệu của khách hàng không bao giờ rời khỏi thiết bị. Khi việc suy luận không tốn kém, cách chúng ta xây dựng sản phẩm sẽ thay đổi hoàn toàn.
Những bộ não nhỏ trong mọi sản phẩm
Để xây dựng với các mô hình cục bộ, trải nghiệm nhà phát triển cần phải tốt hơn nhiều. Bạn cần các mô hình có thể sử dụng thương mại, đánh bại các lựa chọn thay thế về tốc độ và chất lượng, có thể tích hợp vào ứng dụng với vài dòng mã và dễ dàng tìm kiếm.
Hãy coi 100 mô hình đầu tiên như tiểu não, bộ não nhỏ. Bộ não nhỏ xử lý các công việc luôn chạy ngầm – sự cân bằng, thời gian, những kỹ năng mà bạn không bao giờ nghĩ tới, để phần còn lại của bộ não rảnh tay suy nghĩ. Đó là những gì chúng tôi đang xây dựng đầu tiên: các mô hình nhanh, chuyên biệt cho công việc chạy cả ngày, trên thiết bị, hoàn toàn miễn phí.
Sau đó là vỏ não, lớp quyết định mô hình nào sẽ phản hồi. Một mô hình cục bộ nhỏ trước, một mô hình lớn hơn khi công việc yêu cầu, và chỉ sử dụng đám mây khi công việc bắt buộc phải rời khỏi thiết bị. Khi nghiên cứu mở tiến bộ và phần cứng thiết bị trở nên mạnh mẽ hơn, các mô hình cục bộ sẽ phát triển, và chúng tôi sẽ tự huấn luyện các mô hình lớn hơn. Trí tuệ tiên phong, được xây dựng từ quy mô nhỏ nhất.
Các phòng thí nghiệm đám mây phát hành các mô hình trung lập vì giá theo token đòi hỏi một mô hình trung lập. Mỗi mô hình của Desert Ant đều đi kèm với một mặc định mà chúng tôi chọn, cùng các đòn bẩy bạn cần để thay đổi mặc định đó. Chúng tôi tối ưu hóa mô hình và thời gian chạy (runtime) cùng nhau: trên iPhone, Clear và Voz chạy trên Neural Engine, và trong trình duyệt, cùng trọng số đó của Clear chạy qua WebAssembly.
SDK
Bạn đã sẵn sàng bắt đầu chưa? Bạn có thể triển khai các mô hình Desert Ant vào ứng dụng của mình với SDK Swift, Kotlin và JavaScript gốc của chúng tôi, hiện có sẵn trên GitHub.
Tài liệu của chúng tôi được viết cho các nhà phát triển và tác nhân, bạn có thể thử nghiệm các mô hình trên máy Mac bằng CLI, hoặc trong trình duyệt của bạn trên Hugging Face.
Bạn đang xây dựng thứ gì đó thú vị với các mô hình của chúng tôi, hoặc muốn cùng chúng tôi xây dựng chúng? Hãy liên hệ nhé.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.