Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Netlify hỗ trợ mọi mô hình OpenRouter: So sánh thực tế 11 model từ Kimi K3, GLM 5.2 đến DeepSeek V4

(giờ Việt Nam)

Tóm tắt AI

Netlify hiện đã tích hợp OpenRouter, cho phép người dùng tùy chọn bất kỳ mô hình AI nào. Bài viết thực hiện kiểm chứng 11 model khác nhau với cùng một câu lệnh để so sánh hiệu suất thực tế.

Bản dịch AI

More models, more choice: Comparing 11 different AI models

Chúng tôi vừa khởi động quan hệ đối tác với OpenRouter, cho phép chúng tôi cung cấp hai tính năng mới:

Chúng tôi gọi đó là Agent Runners vì chúng tôi chạy một coding agent hoàn chỉnh bên trong, chứ không phải phiên bản rút gọn. Cho đến nay, chúng tôi đã hỗ trợ Claude Agent, OpenAI Codex và Gemini CLI, vốn được tối ưu hóa để chạy các mô hình từ những nhà cung cấp này.

Chúng tôi trang bị cho các agent này những kỹ năng bổ sung và ngữ cảnh về dự án hiện tại, để agent biết chính xác những khả năng nào của Netlify có thể sử dụng (ví dụ: Netlify Database, AI Gateway hoặc Identity), khi nào nên dùng và cách dùng ra sao. Tuy nhiên, để vận hành hiệu quả hàng loạt mô hình mới, chúng tôi đã thêm OpenCode, một lựa chọn agent mã nguồn mở phổ biến, làm tùy chọn mới.

Nhưng với nhiều lựa chọn hơn lại nảy sinh những câu hỏi tất yếu: Làm sao tôi biết mô hình nào phù hợp với mình? Liệu tôi có đang bỏ lỡ thứ gì đó thực sự tốt hơn, tiết kiệm chi phí hơn (để tôi có thể làm được nhiều việc hơn với số credit của mình), hay thứ gì đó sẽ khiến tôi kinh ngạc như internet vẫn đồn thổi? Hiện nay có rất nhiều nỗi sợ bỏ lỡ (FOMO) đang lan truyền.

Để cung cấp cho bạn một số thông tin chi tiết, đây là những gì chúng tôi rút ra được khi chạy cùng một câu lệnh (prompt) trên hàng loạt mô hình… tất cả đều đã có sẵn để bạn sử dụng ngay hôm nay trên Netlify.

Bạn có thể xem kết quả của tất cả các mô hình mà chúng tôi đã thử nghiệm trên trang web này, nơi chúng tôi đã tạo ra báo cáo đầy đủ.

Những gì chúng tôi đã thử nghiệm

Tại Netlify, chúng tôi sử dụng AXIS để tự động đánh giá các mô hình, một công cụ mà chúng tôi vừa mới mở mã nguồn gần đây.

Chúng tôi cung cấp cho AXIS nhiều trường hợp thử nghiệm khác nhau: các câu lệnh để xây dựng một trang web mới và sau đó lặp lại quy trình đó. Chúng tôi hướng dẫn AXIS kiểm tra các câu lệnh này trên những agent và mô hình nào, đồng thời xác định các bài kiểm tra mà AXIS cần thực hiện để đánh giá trang web được tạo ra.

Các bài kiểm tra này tập trung chủ yếu vào chức năng chính xác của trang web được tạo ra thay vì thiết kế, ví dụ: nó có sử dụng cơ sở dữ liệu khi nhu cầu người dùng yêu cầu không? Nó có sử dụng Netlify Database đúng cách trong trường hợp đó không? Trong những trường hợp chỉ cần một trang web tĩnh đơn giản, chúng tôi cũng đảm bảo rằng trang web được tạo ra không bị thiết kế quá mức và không thiết lập cơ sở dữ liệu thừa.

Nếu một mô hình nhất định có điểm kiểm tra thấp, chúng tôi sẽ không cung cấp nó trong Agent Runners. Nếu các mô hình thường xuyên thất bại trong việc áp dụng đúng một trong các kỹ năng của chúng tôi, hoặc mọi thứ vẫn hoạt động nhưng chi phí credit có vẻ bị thổi phồng, thì vấn đề có lẽ nằm ở kỹ năng đó (trong trường hợp này, chúng tôi sẽ tối ưu hóa kỹ năng đó).

Nhưng lần này, chúng tôi muốn cung cấp cho bạn thứ gì đó hữu ích hơn ngay lập tức: khi bạn bắt tay vào xây dựng ước mơ của mình bằng cách sử dụng các mô hình khác nhau với mức tiêu thụ credit chênh lệch đáng kể, bạn sẽ nhận được kết quả gì? Kết quả trông như thế nào?

Chúng tôi đã thử nghiệm ba trường hợp sử dụng tương đối đơn giản:

Với mỗi trường hợp, chúng tôi sẽ cho bạn thấy giao diện của các trang web được tạo ra, nhận xét về các vấn đề đáng chú ý và so sánh số lượng credit cần thiết để tạo ra chúng. Tất nhiên, đây sẽ là một bài kiểm tra mang tính chủ quan hơn nhiều so với các bộ kiểm tra nội bộ của chúng tôi, nhưng nó cũng sẽ rất thú vị. Chúng tôi rất muốn biết ý kiến của bạn về kết quả này!

Tất cả các mô hình đều được chạy với cài đặt mặc định trên Netlify. Một điểm đáng chú ý là hiện tại chúng tôi mặc định chạy GPT 5.6 Sol ở chế độ "low effort" (nỗ lực thấp), mang đến cho bạn một giải pháp thay thế tiết kiệm hơn so với Opus mà vẫn cung cấp kết quả khá tốt (như bạn sẽ thấy bên dưới). Tuy nhiên, cài đặt nỗ lực hiện nằm trong tầm kiểm soát của bạn và các cài đặt mặc định của chúng tôi có thể thay đổi theo thời gian.

Bài viết này sẽ chỉ đề cập đến kịch bản đầu tiên: trang tĩnh cho một quán cà phê, trong khi các bài viết tiếp theo sẽ tập trung vào những trường hợp sử dụng phức tạp hơn. Có rất nhiều điều để xem xét ngay cả với trường hợp đơn giản này, vì vậy hãy bắt đầu thôi.

Kịch bản #1: Quán cà phê địa phương

Đây là câu lệnh đầu tiên của chúng tôi:

Xây dựng một trang web một trang cho một quán cà phê trong khu phố: giờ mở cửa, địa chỉ, thực đơn ngắn gọn và một bức ảnh. Không có gì trên đó thay đổi trừ khi tôi tự chỉnh sửa.

Câu cuối cùng được thêm vào như một gợi ý cho mô hình rằng không cần đến Hệ thống Quản trị Nội dung (CMS) cầu kỳ nào cả. Các kỹ năng mặc định của chúng tôi cũng bao gồm một số hướng dẫn về thiết kế giao diện (UI), chủ yếu để tránh các lỗi thường gặp (ví dụ: kiểu thiết kế "AI rác" màu tím đang bị ghét bỏ) và giúp mô hình suy luận về nhận diện hình ảnh phù hợp với yêu cầu của người dùng. Nhưng ngoài ra, mỗi mô hình đều được tự do xây dựng những gì nó nghĩ là chúng ta muốn.

Trước khi tiết lộ giao diện các trang web, đây là bảng so sánh mức tiêu thụ credit cho mỗi mô hình mà chúng tôi đã thử nghiệm. Mỗi mô hình được chạy ba lần và việc nhấp vào bất kỳ kết quả nào sẽ đưa bạn đến trang web thực tế đã được tạo!

Phân bổ đó khá rộng phải không? Không chỉ vậy: mức trung bình của Claude Opus bị lệch đáng kể lên trên vì một trong ba lần chạy của nó đã tiêu tốn tới 1.055 credit! (Xin nhắc lại, với gói miễn phí bạn có 300 credit; với gói Personal có 1.000 credit đi kèm; và với gói Pro có 3.000 credit đi kèm. Các gói credit bổ sung cho Pro có giá 10 đô la cho mỗi 1.500 credit.)

Câu hỏi đặt ra ngay lúc này là: liệu khoản chi phí cho Opus có xứng đáng không? Và các mô hình khác mang lại những sự đánh đổi nào? Hãy cùng bắt đầu tìm hiểu.

Claude Opus 5

Đây là trang đầy đủ được tạo bởi lần chạy tiêu tốn 1.055 credit đó (nhiều hơn khoảng 4 lần so với bất kỳ lần chạy nào khác).

Thành thật mà nói, tôi thấy nó rất thú vị và đầy đủ chi tiết cả về thiết kế hình ảnh (hãy xem phần tử "giống con dấu" với hạt cà phê ở giữa: đó là một phần tử văn bản thực sự có thể tạo hiệu ứng động) và bản đồ tùy chỉnh ở phía dưới. Chế độ tối (dark mode) hoạt động ngay lập tức - hãy kiểm tra trang web trực tiếp trong các liên kết ở trên.

Tất nhiên, chúng tôi không cung cấp rõ ràng cho mô hình bất kỳ chi tiết thực tế nào về quán cà phê của mình (ngoại trừ việc nó là một quán "trong khu phố", điều này thực sự đã hướng tất cả các mô hình đi theo một hướng nhất định). Ngôn ngữ thiết kế mang phong cách hiện đại nhưng có lẽ đã trở nên sáo rỗng (ví dụ như tiêu đề dùng hai phông chữ, hai màu), nhưng này - chúng tôi đâu có đưa ra chỉ dẫn nào khác.

Vậy, hai lần chạy còn lại của Opus diễn ra như thế nào? (253 credit được sử dụng ở bên trái; 249 ở bên phải)

Cũng không tệ chút nào! Đồ họa vector thực sự đòi hỏi rất nhiều công sức từ các mô hình, và các ví dụ trên gần như đã chạm ngưỡng những gì LLM hiện nay có thể đạt được (thành thật mà nói, vẫn chưa ở mức tốt so với việc tạo hình ảnh hoặc văn bản).

Về việc liệu kết quả đầu tiên có thực sự "tốt hơn gấp 4 lần" hay không, ý kiến có thể khác nhau. Nhưng trong tất cả các thử nghiệm tôi đã thực hiện, Opus có xu hướng tiêu tốn credit quá mức (so với mức cơ bản "điển hình" của nó) nhiều hơn các mô hình khác. Tuy nhiên, điều đó không đảm bảo kết quả sẽ tệ hơn hay tốt hơn. Đó chỉ là điều thường xuyên xảy ra.

Hãy xem xét một số mô hình khác và sau đó suy ngẫm về những gì chúng ta có thể học được.

Claude Sonnet 5

Đây là ba ứng cử viên của chúng tôi, với trung bình 143 credit (81 credit · 245 credit · 103 credit):

Vẫn có một số chi tiết thú vị trong mỗi trang này, chỉ là ít hơn (và nội dung nhìn chung cũng ít hơn). Đồ họa vector đơn giản hơn đáng kể và không thực sự là thứ bạn sẽ cân nhắc cho một trang web thực tế. Điều này không nói lên khả năng viết mã phức tạp hay trả lời các câu hỏi triết học của mô hình này, nhưng chúng ta không yêu cầu điều đó ở đây. Ở mức giá này, hãy xem OpenAI, Google và Kimi có gì để cung cấp.

GPT 5.6 Sol (low effort)

Điều gì sẽ xảy ra khi chúng ta lấy mô hình đẳng cấp Opus của OpenAI và yêu cầu nó dành ít thời gian suy nghĩ hơn một chút?

(Trung bình 141 credit: 173 credit · 158 credit · 92 credit)

Nhìn vào kết quả, tôi nghĩ mô hình hàng đầu của OpenAI ở chế độ nỗ lực thấp đã thắng mô hình tầm trung của Anthropic về trực giác thiết kế cơ bản, ít nhất là trong kịch bản này. Nội dung phong phú hơn và không có các hình dạng vector kỳ quặc (mặc dù hình ảnh hơi chung chung).

GPT 5.6 Terra

NetlifyOpenRouterAI ModelsSo sánh AILập trình
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.