Jiqizhixin
88

Nghiên cứu

Kỷ nguyên Harness trong đánh giá AI: 15 tổ chức học thuật ra mắt HarnessEval

(giờ Việt Nam)

Tóm tắt AI

HarnessEval định nghĩa lại cách đánh giá các hệ thống AI phức tạp bằng cách xây dựng một quy trình kiểm chứng có hệ thống, thay vì chỉ dựa vào các mô hình chấm điểm đơn thuần.

Bản dịch AI

Các mô hình lớn (Large Models) mở ra kỷ nguyên "trường độ", công ty mới của Dương Thực Lân (Yang Zhilin) đã đưa dung lượng khung hội thoại lên vị trí số 1 thế giới.

Tác giả gốc của Machine Heart (Jiqizhixin): Trương Thiến. Mặc dù chúng ta không biết ai sẽ là OpenAI tiếp theo, nhưng... 150.000 chữ, và trong quá trình kiểm thử thực tế, chúng tôi phát hiện nó thậm chí có thể xử lý 200.000 chữ cùng một lúc, tương đương với...

Machine Heart (Jiqizhixin)

Mô hình khuếch tán video trong kỷ nguyên AIGC, nhóm nghiên cứu từ Đại học Phúc Đán và các đơn vị khác công bố bài tổng quan đầu tiên trong lĩnh vực này.

Chuyên mục Machine Heart, Ban biên tập Machine Heart. Nội dung do AI tạo ra (AIGC) đã trở thành tâm điểm của trí tuệ nhân tạo hiện nay... Phòng thí nghiệm Thị giác và Học tập của Đại học Phúc Đán phối hợp cùng các tổ chức học thuật như Microsoft, Huawei đã công bố... đầu tiên.

Machine Heart (Jiqizhixin)

"Harness" trong hệ thống AI: Sự tiến hóa từ công cụ kiểm thử đến hệ thống điều khiển tác nhân (Agent).

Tính đến phiên bản v5.0, đã nhận được 17.457 kết quả hiệu năng từ 23 tổ chức. Trong Machine... eval-harness trở thành backend của Hugging Face Open LLM Leaderboard năm 2024...

Góc nhìn ngoài Stack

Đừng lo lắng, những khái niệm thuật ngữ gây hoa mắt xuất hiện sau khi AI trỗi dậy có lẽ chỉ là những trạng thái trung gian.

MCP, Skill, Harness, Bản thể luận (Ontology)... Những từ này trước đây chỉ xuất hiện trong các bài báo học thuật và công... Các mô hình ngôn ngữ lớn về bản chất là những cỗ máy thống kê — những cỗ máy thống kê cực kỳ tinh vi — nhưng nó đã...

Hai sinh vạn vật

"Harness" trong ngành công nghiệp AI: Khái niệm, động lực, kiến trúc và thực tiễn điển hình.

Benchmark harness kết nối "mô hình/tác nhân được kiểm thử" vào các tác vụ và môi trường tiêu chuẩn... Nó giải quyết vấn đề gì? Khả năng tái lập, loại bỏ tranh cãi kiểu "chạy được trên máy tác giả". Tính công bằng, mỗi...

Ngồi bên cửa sổ nhìn thế giới

Giải mã chuyên sâu về Harness Engineering: "Dây cương và yên ngựa" trong kỷ nguyên AI Agent.

Tối ưu hóa Harness giúp nâng hạng Benchmark từ 30+ lên top 5. Bài giải mã này tổng hợp... Mọi trạng thái đều phải được thiết kế ở định dạng "máy có thể đọc được". Thành phần 4: Vòng lặp tự sửa lỗi, bất kỳ...

Máy móc hiểu ngôn ngữ

Harness, Lâm Tuấn Dương (Lin Junyang), đường đua nghìn tỷ đô và lòng bàn tay của Anthropic.

Khái niệm công nghiệp cốt lõi nhất của thời đại. Xung quanh nó đang hình thành một quy mô nghìn tỷ đô la... Đồng sáng lập Mitchell Hashimoto đã đưa "AI Harness" trở thành một khái niệm chính thức...

Silicon Star Pro

Lõi công nghệ | AIIA DNN benchmark chính thức công bố kết quả đánh giá vòng đầu tiên trên nền tảng đám mây v0.5.

Hỗ trợ toàn diện cho sự phát triển của ngành đánh giá từ nhiều góc độ. Trong lịch sử phát triển của các mô hình học sâu... Năm chiều kích đo lường hiệu năng chip. Liên minh Công nghiệp Trí tuệ nhân tạo Trung Quốc dựa trên các chỉ số được cân nhắc trong quá trình triển khai thực tế... Bảng xếp hạng năng lực "Chip" hỗ trợ doanh nghiệp quảng bá. Trong bối cảnh thiếu tiêu chuẩn đánh giá...

Liên minh Công nghiệp Trí tuệ nhân tạo (AIIA)

Dẫn đầu kỷ nguyên trí tuệ, khả năng vô hạn! Tại hội nghị nhà phát triển trí tuệ nhân tạo hôm nay, chúng ta đã nhìn thấy tương lai!

Nhà sáng lập kiêm CEO Machine Heart 15:35-15:55 Giải cấu trúc AI trao quyền cho ngành văn hóa giải trí mới, Đổng Tuệ Trí, Đồng sáng lập & COO Video++ 15:55-16:00 Lễ công bố đợt đầu các phòng thí nghiệm liên kết AIIA...

SIP Technology Leader

Can Anything Be a CLI? | Khi phần mềm bắt đầu mọc ra Harness cho Agent sử dụng.

Kỹ thuật của harness. Nhưng phần khó nhất của self-evolution (tự tiến hóa) chính là Eval (đánh giá). Nếu tuân theo các tiêu chuẩn học thuật truyền thống, sẽ không thể tránh khỏi việc cần đưa vào đánh giá của con người hoặc các mô hình mạnh hơn để thực hiện...

thinkingloop

1234567 Trang tiếp theo

Tìm thấy khoảng 66 kết quả

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Jiqizhixin. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.