发布时间:2026-08-12
信息来源:北京国际科技创新中心微信公众号
字体:
大
中
小
打印
发布时间:2026-08-12
信息来源:北京国际科技创新中心微信公众号
AI(人工智能)已经能聊天、写代码、用工具之后,下一步是什么?北京智源人工智能研究院(以下简称:智源研究院)给出了一个答案——自主研究。8月11日,智源研究院发布自主研究智能体AREX,AI已进化到能够自己开展研究了。
研发人员表示,自主研究的核心意义在于,AI发展不再受限于人类知识边界,而是形成了“投入能源、转化智力”的全新模式。值得注意的是,自主研究的真正难题并非信息搜索不足,而是智能体能否明确当前答案已成立什么、欠缺什么,以及下一步最该研究什么,从而在复杂约束中持续逼近正确答案。
AREX正是围绕此问题提出。它抓住“发现—验证不对称性”这一关键突破口:完整答案难以一次生成,但候选解一旦形成,即可通过逐项约束验证快速定位不足、指导后续探索。这一思想与谷歌前首席科学家Jeff Dean提出的Discovery Loop理念相呼应——未来AI需通过持续实验、反馈与修正形成自主发现能力。
AREX搭建了一套“双循环”框架:内层循环负责“研究”——智能体会围绕当前研究问题搜索信息、调用工具、收集证据,形成一个暂定答案。外层循环负责“改进”——对暂定答案逐项审计,判断哪些条件已经充分验证、哪些还缺少证据、哪些需要重新研究。如果还有未解决的问题,验证结果会被转化为下一轮的研究目标,让AI在“研究→验证→再研究”的循环中不断逼近正确答案。
智源团队在阐述AREX核心思想时表示,长程研究中真正难的不是例行搜索和访问网页,而是在关键时刻做对决定,决定什么时候相信一个证据、什么时候放弃一个候选项、什么时候重整上下文并改变搜索方向,这些才是决定研究成败的步骤。
为了验证AREX是否具备真实自主研究能力,智源研究院在六个基准上进行了评测,包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它们分别覆盖信息深度、信息广度、深度与广度结合,以及端到端智能体能力。AREX-Base以10B激活参数在多项指标上达到或超越部分闭源旗舰模型,展现出均衡的综合竞争力。
据了解,AREX 模型权重现已开放下载,并同步发布科研体验版线上系统,为用户提供行业信息深度整合、个性化热点追踪等技术服务。
智源研究院还在此基础上推出了AREX研究平台,将AI的自主研究能力封装为面向科研人员和产业用户的日常工具。该平台以模型驱动的内容获取与研究智能体为核心,提供资讯追踪、论文筛选、播客提取等功能,未来还将延伸至方案设计、工程实现与性能调优等研究执行阶段。
相关人物