Nghiên cứu sử dụng mô hình BlameBERT để phân tích dữ liệu nghị trường, phát hiện xu hướng chỉ trích hình "quả chuối": giảm dần đến năm 2016 và tăng vọt từ 2019, chịu ảnh hưởng mạnh mẽ bởi sự phân cực ý thức hệ.
GameHorizon Suite cung cấp bộ dữ liệu AAA khổng lồ với 5.000 giờ chơi, kèm theo công cụ tự động gắn nhãn và hệ thống đánh giá toàn diện, mở ra kỷ nguyên mới cho AI trong game.
Bộ công cụ mới của Baidu và Faxingbao hỗ trợ toàn diện từ phân tích vụ việc, quản lý chứng cứ đến soạn thảo văn bản, với dữ liệu 180 triệu vụ án thực tế đảm bảo tính xác thực và khả năng truy xuất nguồn gốc.
Hơn 3,1 triệu bài báo từ arXiv đã được tổng hợp thành bộ dữ liệu khổng lồ 16TB trên HuggingFace, bao gồm đầy đủ các định dạng từ LaTeX đến PDF, hỗ trợ đắc lực cho nghiên cứu AI.
Bộ Môi trường và Tổng cục Quản lý thị trường Trung Quốc vừa ban hành quy định mới nhằm chấn chỉnh hoạt động kiểm định khí thải, áp dụng công nghệ dữ liệu lớn và AI để phát hiện gian lận, kiên quyết loại bỏ các đơn vị vi phạm nghiêm trọng.
Nền tảng cung ứng yếu tố thông minh 'Nhà máy Token hàng hải' vừa ra mắt tại Thanh Đảo, cung cấp hơn 130 loại dữ liệu chuyên ngành, sức mạnh tính toán 800P và tích hợp hơn 50 mô hình AI lớn để phục vụ phát triển kinh tế biển.
Ant Group ra mắt OmniTable, hệ thống giúp tối ưu hóa quản trị dữ liệu cho các mô hình ngôn ngữ lớn quy mô PB. Giải pháp này đã giúp rút ngắn thời gian xử lý dữ liệu SFT từ 14 ngày xuống còn 2,5 ngày, đồng thời giảm đáng kể các thao tác thủ công.
Tính đến cuối tháng 6, Trung Quốc đã xây dựng thành công hơn 70 tuyến đường truyền dữ liệu tốc độ cao kết nối các trung tâm tính toán. Đầu tư vào các lĩnh vực hạ tầng số như mạng lưới tính toán và viễn thông tăng trưởng mạnh, khẳng định cam kết thúc đẩy nền kinh tế số quốc gia.
Nền tảng điện toán quốc gia Trung Quốc đã kết nối 31 tỉnh thành, quy tụ hơn 10.000 doanh nghiệp và 300 mô hình AI lớn. Đến cuối tháng 6, quy mô tính toán thông minh đạt 2185 EFLOPS, tăng trưởng ấn tượng 177% so với cùng kỳ.
Trước áp lực cạnh tranh, các doanh nghiệp bán lẻ, sản xuất và dịch vụ cần tái định hình mô hình quản trị linh hoạt, lấy dữ liệu và AI làm nền tảng cốt lõi để tối ưu vận hành.
Nghiên cứu sử dụng ba mô hình sông băng toàn cầu kết hợp với các kịch bản biến đổi khí hậu để dự báo chính xác thời điểm từng dòng sông băng trên thế giới sẽ tan biến, hiển thị trực quan qua bản đồ tương tác.
Databricks giới thiệu phương pháp đồng bộ hóa khả năng quản trị dữ liệu xuyên suốt các công cụ và danh mục khác nhau trong kiến trúc Open Lakehouse, nhằm đảm bảo tính nhất quán và bảo mật cho hệ sinh thái dữ liệu mở.
Cloudera tích hợp các mô hình của Mistral vào nền tảng dữ liệu lai, cho phép doanh nghiệp triển khai AI trong môi trường riêng tư, bảo mật và tự chủ hoàn toàn với dữ liệu nội bộ.
Perplexity Search inside Hermes. Perplexity's index currently includes 450B+ high-quality URLs. Rapi…
DịchPerplexity vừa tích hợp Hermes vào công cụ tìm kiếm, nâng tổng số chỉ mục lên hơn 450 tỷ URL chất lượng cao và đặt mục tiêu đạt mốc nghìn tỷ vào cuối năm nay.
Google DeepMind giới thiệu AlphaGenome Atlas, sử dụng mô hình AI để dự đoán tác động điều hòa của 9 tỷ biến thể di truyền ở người, tạo nên bộ dữ liệu khổng lồ 1 PB phục vụ nghiên cứu y sinh.
Amap xác nhận đang phát triển tính năng 'Bảng xếp hạng né mìn' (Mine-Sweeping List) sử dụng AI và dữ liệu lớn để cảnh báo người dùng về các địa điểm có trải nghiệm kém, giá cao hoặc quá tải, dự kiến ra mắt trong sự kiện sắp tới.
RoboTok là hệ thống đột phá giúp trích xuất các video thao tác của con người từ Internet để huấn luyện robot, giải quyết bài toán thiếu hụt dữ liệu thực tế thông qua không gian chuyển động 3D linh hoạt.
Vì sao đáng đọc: Giải quyết trực tiếp nút thắt lớn nhất trong robot học là dữ liệu. Phương pháp tìm kiếm dựa trên chuyển động 3D rất sáng tạo và có tính ứng dụng thực tiễn cao.
Bộ Tài nguyên Trung Quốc chính thức cho phép khai thác thương mại dữ liệu từ mạng lưới hơn 7.500 trạm Bắc Đẩu, thúc đẩy ứng dụng trong xe tự lái, kinh tế tầm thấp và quản lý đô thị thông minh.
Google Research đánh giá hiệu quả của việc chuyển đổi điểm rủi ro đa gen (PRS) từ dữ liệu người châu Âu sang người Nhật, cho thấy việc tăng quy mô mẫu không phải lúc nào cũng mang lại kết quả dự đoán chính xác hơn.
Databricks chia sẻ phần tiếp theo về cách Southern Company ứng dụng nền tảng dữ liệu để tối ưu hóa dự báo và ứng phó với các cơn bão, hoàn thiện bức tranh về hệ thống SCOUT.
Over 4 petabytes of models and datasets have been uploaded to HF just last week by AI builders and t…
DịchChỉ trong tuần qua, cộng đồng AI đã tải lên hơn 4PB dữ liệu lên Hugging Face, tương đương với khoảng 800.000 bộ phim HD, khẳng định vị thế nền tảng lưu trữ và cộng tác AI hàng đầu thế giới.
Cục trưởng Lưu Liệt Hoành đề xuất các mô hình kinh doanh như đăng ký giá trị gia tăng theo token và thanh toán theo hiệu quả trong các lĩnh vực trọng điểm. Trung Quốc cũng sẽ mở rộng thí điểm dán nhãn dữ liệu tại 32 thành phố, với lưu lượng gọi token hàng ngày đạt hơn 500 nghìn tỷ.
Tính đến cuối tháng 7, quy mô tính toán thông minh của Trung Quốc đạt 2,45 triệu PFLOPS, với hơn 85% tập trung tại các trung tâm dữ liệu trọng điểm. Đồng thời, số lượng bằng sáng chế về tác nhân AI (AI agents) tại nước này cũng tăng trưởng mạnh, gấp đôi so với năm trước.
Năm 2025, số lượng bằng sáng chế về AI Agent tại Trung Quốc vượt mốc 3.400, tăng gấp đôi so với năm trước. Đồng thời, quy mô hạ tầng tính toán thông minh và ngành công nghiệp dữ liệu nước này cũng ghi nhận mức tăng trưởng ấn tượng.
Tại Hội chợ Dữ liệu lớn Quốc tế 2026, Cục Dữ liệu Quốc gia Trung Quốc công bố đã xây dựng được hơn 126.000 bộ dữ liệu chất lượng cao với tổng dung lượng vượt 1815PB, tăng trưởng mạnh mẽ 89% chỉ sau một quý.
Trackunit tận dụng AI để phân tích dữ liệu thiết bị và quy trình vận hành, giúp các doanh nghiệp xây dựng tối ưu hóa hiệu suất máy móc và dự báo bảo trì chính xác.
Bộ Công nghiệp và Công nghệ thông tin Trung Quốc vừa chỉ định 17 tỉnh, thành phố làm nút khu vực để xây dựng hệ thống kết nối hạ tầng tính toán theo mô hình "1+M+N", nhằm tối ưu hóa việc điều phối tài nguyên và dữ liệu trên toàn quốc.
Databricks giới thiệu các đột phá công nghệ mới tại hội nghị VLDB 2026, tập trung tối ưu hóa nền tảng dữ liệu thông minh thông qua kiến trúc Lakebase và xử lý luồng dữ liệu thời gian thực.
Nghiên cứu giới thiệu BaguanHR, một khung làm việc mới sử dụng kỹ thuật siêu phân giải (SR) để tổng hợp dữ liệu thời tiết 0.1 độ từ nguồn ERA5, khắc phục hạn chế về dữ liệu độ phân giải cao trong các mô hình dự báo thời tiết AI hiện nay.
LibriBrain100 cung cấp hơn 100 giờ dữ liệu MEG chất lượng cao từ việc nghe ngôn ngữ tự nhiên, thiết lập kỷ lục mới về dữ liệu thần kinh chuyên sâu cho nghiên cứu giải mã não-thành-văn bản.
LAION ra mắt LAION-BVD, bộ dữ liệu mở gồm 80 triệu video với tổng thời lượng 10 triệu giờ, hỗ trợ huấn luyện các mô hình đa phương thức video-âm thanh-hình ảnh hiệu suất cao.
Nghiên cứu đề xuất 'Định luật làm đặc' để giải quyết nút thắt hiệu năng khi xử lý dữ liệu người dùng quy mô tỷ đơn vị, đồng thời giới thiệu phương pháp ALGN giúp tối ưu hóa việc phân tách từ (tokenization) cho các hệ thống gợi ý.
DịchOx Alpha vừa thiết lập cột mốc ấn tượng khi xử lý khối lượng dữ liệu khổng lồ lên tới 26 nghìn tỷ token chỉ trong vòng 4 ngày, cho thấy bước tiến lớn về hiệu suất tính toán.
VietinBank đẩy mạnh ứng dụng AI và dữ liệu lớn để tối ưu hóa dịch vụ, chuyển dịch từ số hóa đơn thuần sang mô hình ngân hàng thông minh, tạo giá trị bền vững cho khách hàng và doanh nghiệp.
Amtrak đang hiện đại hóa hệ thống bằng cách biến mỗi đoàn tàu thành một tài sản tạo dữ liệu, kết nối thông tin vận hành và bảo trì để tối ưu hóa quy trình quản lý.
Các nhà thiên văn học vừa ra mắt bản đồ vũ trụ 2D quy mô nhất từ trước đến nay, tổng hợp dữ liệu từ 13 năm quan sát để hiển thị chi tiết 4 tỷ thiên thể, tạo nền tảng quan trọng cho các nghiên cứu về năng lượng tối.
DịchDự án OpenCode Go vừa ghi nhận kỷ lục mới khi xử lý thành công 11 nghìn tỷ token chỉ trong một ngày, đánh dấu bước tiến quan trọng trong năng lực xử lý dữ liệu quy mô lớn.