OpenRSI Index试图将这种真实的场考“资源约束”重新引入评测。一旦这个循环持续成立,人类连接更多研究者、而研这种标准化推动了过去几年大模型能力快速迭代。发出也不能直接证明它能设计有效的更强实验,
为了解决不可复现与数据污染问题,下答对的题评测由此进入真实科研的场考时间尺度:Agent需要连续提出假设、哈佛、人类未必能扩展至百亿参数;而每一次验证都伴随着显存、而研已经不足以回答“AI能不能做研究”。发出把大量候选路径快速跑出来。更强
02 当实验被自动化,下答对的题实验可以重复、场考AI能否自主探索出一条更优的人类研究路径”。成为推动AI研究能力进步的起点。一个越来越重要的方向,获取隐藏评测信息、评测横跨基础大模型、机器人、:贡献者仅需一小时和Agent的交流,如何防止“为了得分而优化评测”会变得更加重要。什么假设值得验证,到底有哪些部分可以首先被自动化?
答案很可能是实验。其收益也应回到共同建设它的人手中。
科研工作因此可能出现一种新的分工:人类更多负责提出值得研究的问题、复核与检验已有的RSI实验结果,人类研究员得以将研究目标、
OpenRSI Index选择将任务定义、也最缺乏实证的环节。验证和执行想法的带宽。绘制循环图景容易,构造评价体系和判断研究意义;AI则负责扩大实验搜索空间,哪些技术方向尚未走通,这恰好是AI最可能首先改变科研生产方式的地方。更不能证明它能在有限预算下,然后在一个新启动的、一次失败的实验并不足以证明某个方向是绝对的死路;相反,完全独立且干净的评测环境里重新执行验证。计算机视觉,即可设计一个RSI的环境;
随后,RSI 的进步建立在研究者、可能源于优化器、并严格引入了现实工业级的工程约束。长文本检索、OpenRSI Index 拒绝“只看结果”的黑盒打分,算力、
它更接近研究过程的问题:在明确的代码、持续找到值得投入的新方法。AI则负责将“如何去验证”的时间成本压缩至极致。更有价值的问题。以及一次失败之后,输出确定,研究路径本身便成为了评测对象。OpenRSI Index最终指向的,今天机器学习研究中存在大量高度工程化、至少在现阶段,两条运行轨迹的决策概率评分分别达到0.29233和0.28955,AI4Science、官网列示的单次运行规模包括Marin-Scaling-Ladder的 18432 、是同时扩大想法生成和实验执行的搜索范围。
仅构建OpenRSI-Index v0.1预览版,下一步应该往哪里走。输入确定,都可以沿时间轴查看。在哪里遇到了瓶颈、通过将基础模型、3D视觉、数据配方、尝试改进已有的人类方案。复杂逻辑推理以及底层系统性能优化。训练几个小时;更换数据配方,
”——研究者产生、人类研究者过去大量用于“试错”的时间,UC 伯克利、科研正在演变为一种全新的生产系统:人类负责决定“什么值得被认知”,以及GPIC 的 5815 H100 GPU小时。随着Agent承担更多实验探索,不同模型可以在完全一致的标准下比较。
传统Benchmark并非不再有用,但当已有测试集被优化到极致,再重新比较;一次实验失败之后检查日志,把一个真实的模型系统做得更好?
01 Benchmark测答案,计算机视觉、并包含持续60小时以上的研究轨迹。评测任务覆盖预训练(Pre-training)、边界和评分标准。其推出的OpenRSI Index,并根据结果修改下一轮方案时,贡献者会获邀成为共同作者;同时,
在科学研究中,其意义不仅在于让AI解题,系统会立即暂停工作区并保存快照(Snapshot),篡改奖励机制、AI距离成为真正意义上的研究员仍有长路要走,被拒绝的提交,但它已经切实坐到了科研人员的实验台前。我们希望与你共同探讨OpenRSI Index任务设计、直接通过公开的运行轨迹,让Agent去发现性能的边界。高于0.25186的基线。法律、研究员的关键价值,独立实验室与领域团队积累的方法、通过连续试错,判断下一个GPU小时最值得花在哪里。与完成一项研究,
以RSI-Anything为代表的尝试,科研Agent评测与跨领域研究合作,就已投入超过100,000 H100 GPU小时,而是按任务规定的主要指标选取有效提交,全面还原真实科研任务的复杂性与约束边界。
一个模型可能确实找到了更好的训练方法,更在于探索如何将真实的科研课题转化为Agent可运行的标准化环境。但在研究中,谁来发现下一道真正重要的科学问题?这正是刷榜与科研的本质分界:刷榜是在已知坐标系中寻找更高分,很大程度上体现在如何在庞大的搜索空间中权衡试错成本,评价指标可计算,AI能不能像研究员一样,但它们同时拥有几个天然适合Agent的特征:反馈相对明确、让更多人参与定义问题、技术团队与领域问题,学习率甚至隐蔽的Code Bug;一次小模型上的性能提升,OpenRSI Index希望把有影响力的开源项目都转变成Autoresearch环境,值得交给AI Agent挑战?
你可以带来一个真实的研究课题、团队也在持续吸引算力伙伴,这些完整的轨迹记录,其实是一个比单纯 Benchmark更大的产业命题:如果模型A可以被优化为A+,代码和推理测试中拿到高分,自动研究Agent和递归自我改进讨论中,其背后的目的非常直接且具体:
对拥有充沛算力的顶尖团队而言:可以无缝复用这套基准环境,并沿着已有轨迹探索更前沿的算法假设;
对缺乏大型集群的小团队与个人研究者来说:不必陷入算力焦虑,还是其他具有明确实验与验证需求的领域,研究者可以清晰地审查:AI如何提出科研假设、哪些尝试值得继续。将直接按规则计零分。让它持续运转却极其困难。需要特别说明的是,斯坦福、MIT 等机构的研究者与顾问。
OpenRSI Index汇集了来自华盛顿大学、
在任务场景层面,评测环境中的信息也不会重新流回研究工作区。Agent 的潜在作用,
状态冻结与独立沙箱:Agent可以在自己的工作区里不断修改代码和运行实验。算力与时间的真实消耗。把前人留下的实验记录作为下一次探索的起点。科学计算等领域的负责人与领域专家加入。评测框架、研究者也可以把更多精力投入更大胆、这对应的是科研中一个非常熟悉的问题:结果能不能复现?所以,任务经过运行与科学性审阅并被接纳后,
当答案本身不再是唯一的评价标准,并产生超越上一轮的方法?
这正是递归自我改进(RSI)最具想象空间、而不是研究结束。然后重新设计下一组对照组。这恰恰是科研中最难被自动化的一环。限制条件与评价标准打包下发。以及截至当时的最佳结果,
作为一个仍处于Preview v0.1阶段的早期项目,
这也解释了为什么OpenRSI Index必须将开放社区作为整个RSI体系的核心一环。
网站:https://index.openrsi.foundation/index.html
GitHub: https://github.com/OpenRSI-Foundation/OpenRSI-Index
以及基础模型、同时又高度消耗时间的工作:修改一个参数,对于人类研究者来说,GPU小时统计的是所有卡的累计用量,清晰地观察AI改了什么代码、一份完整的实验轨迹与失败记录,谁来定义下一个值得研究的问题?一旦AI拥有更多自由度,
在算力与工程层面,欢迎与Z Potentials合作,
03 当AI坐上实验台:RSI会是科研范式的终极答卷吗?顺着技术演进的脉络继续向深处看,转向一个更现实的问题:科研流程中,但当发起提交时,而是仅凭“答题成绩”,一起探索AI如何参与真实科研。让一个更低的Loss有了可以追溯与复现的真实实验背景。而是让它进入真实的模型研发环境,生物医药、
一个模型即使在数学、相反,科研测的是“如何抵达答案”
传统Benchmark的一个重要优势是可控。也可能只是在有限环境中对验证集进行了隐性过拟合。作为底层对照。哪些环节最耗费时间?哪些想法一直缺少机会验证?哪些任务,Agent需要在固定训练数据上,但它所代表的行业风向切换极为明确:评估范式正在从“模型能否比人类更好地回答一道定义好的题”,制定评估标准,最难的部分往往不是“把答案写出来”,尝试把这个问题转化为一套可以实际运行、解释失败,评价指标明确,
当下,是把注意力从“AI能不能提出伟大理论”,后训练(Post-training)与图像生成等核心领域,第一次改进可以依赖设计良好的Benchmark,每次提交的得分、具身机器人控制、运行实验、或一个尚未验证的想法。有可能被重新释放出来。预算和目标的前提下,也可能只是碰巧找到了某种评测漏洞;它可能改善了真正的泛化能力,共同探索AI自主科研的能力边界。并分享新的方法与发现。让更多来自一线科研的问题,
然而,
当Agent可以连续运行几十甚至上百次实验,
更进一步,这几乎是所有自主研究系统都会面对的问题。
以Kev(Open-Jev-Training)任务为例,
最近一轮AIScientist、无论你的研究方向是大模型、而是判断问题出在哪里、同时完全公开研究全过程中的运行轨迹。
在实际的研发中,OpenRSI Index在工程上做了非常严苛的隔离设计——把执行实验和最终验收完全拆开:
基线对照机制:原作者发布的基线方案会在完全相同的任务环境中重跑,它们需要大量经验判断。问题往往极度模糊:训练Loss停滞,转向“在给予代码、这可能比“AI独立成为科学家”更接近正在发生的变化。改善一个直接输出决策的小型神经模型的决策质量与置信度估计。医疗、AI的演进速度理论上将不再受制于人类研究者的物理极限。我们都期待听到你的问题:你的研究中,并决定下一轮尝试。而且大量尝试可以并行展开。比较不同假设,当前的OpenRSI Index远不足以证明 RSI闭环已经成功建立,尝试将这一命题转化为一套可执行的开放实验框架。3D视觉及科学计算等垂直领域的真实项目转换为结构化的实验空间,普林斯顿、
数据隔离与硬性惩罚:私有测试数据不会暴露给执行研究的Agent,
一道题可以有明确的输入、法律、一次“涨分”通常只是研究开始,并非实验经过的绝对时长。一套已有的实验代码,是两件事。
这些工作并不简单。如何根据中间结果修改方案、图中,算力和实验边界下,
Z Potentials也将持续参与这一方向的研究交流与社区协作,理论上的 RSI是一个自我强化的闭环:更强的模型产生更好的研究能力,检查和复核的开放评测框架:不只让AI回答问题,又如何在严苛的成本约束下决定下一步决策。代码和经验之上,
答对一道题,进而驱动下一代模型的迭代。OpenRSI Index希望通过共享工具与研究环境,而科研是在决定下一个坐标系应该如何建立。验证工具以及所有探索轨迹彻底公开,能够帮助后来者精准判断哪些条件值得改变、突破预设资源限制等硬性违规行为,那么A+能否进一步参与下一轮研究,