Hacker News: AI bài nổi bật
85

Nghiên cứu

Thử nghiệm Qwen3.8: Khả năng suy luận tương đồng với mô hình GPT-5.5 Pro

(giờ Việt Nam)

Tóm tắt AI

Tác giả wsxiaoys cập nhật thử nghiệm prefill v1.1, sử dụng GPT-5.5 Pro làm chuẩn để đo lường độ tương đồng trong suy luận của các mô hình mã nguồn mở trên 45 câu hỏi đa lĩnh vực.

Bản dịch AI

HN: https://news.ycombinator.com/edit?id=49630026

Reasoning prefills trên một số mô hình mở, v1.1

Phần tiếp theo của Reasoning prefills trên một số mô hình mở và Stolen Thoughts

Phiên bản v1.1 này chạy lại thử nghiệm reasoning-prefill với GPT-5.5 Pro đóng vai trò là mô hình giáo viên (teacher).

Đối với mỗi bài toán, tôi đã tạo hai phản hồi từ mỗi mô hình mục tiêu:

Câu trả lời hiển thị vẫn được tạo tự do. Sau đó, tôi đo lường mức độ xuất hiện câu trả lời hiển thị của mô hình giáo viên trong 100 token đầu tiên của câu trả lời từ mô hình mục tiêu. Tương tự như bài viết trước, mỗi điểm số là giá trị trung bình của unigram, bigram và trigram source recall. Các giá trị Delta là mức thay đổi tuyệt đối theo điểm phần trăm.

Tất cả các bài toán

Đánh giá bao gồm 45 bài toán: 15 bài toán STEM, 15 bài toán phi STEM và 15 câu đố tổng hợp (synthetic puzzles).

Qwen theo danh mục

Thảo luận

Qwen hầu như không thay đổi hướng về phía Opus 4.8 trong thử nghiệm trước đó, nhưng đã dịch chuyển +18,18 điểm về phía GPT-5.5 Pro trong thử nghiệm này, bao gồm cả tác động lớn đối với các câu đố tổng hợp riêng tư. Dữ liệu cho thấy Qwen có thể đã học từ GPT-5.5 Pro, hoặc từ một mô hình GPT có liên quan chặt chẽ, thay vì từ Opus.

Kimi K3 có mức độ trùng lặp cao nhất với GPT-5.5 Pro cả khi không có và có prefill (lần lượt là 31,11% và 35,65%), mặc dù prefill chỉ đóng góp thêm +4,54 điểm.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.