Kaka Web3Kaka Web3
产品内容日历下载
EN
KAKA WEB3快讯

OpenScience自测75.7%超过Codex:科研Agent开始自己循环跑实验

律动 BlockBeats·2026-09-28 19:08 GMT+8
动察 Beating AI 快讯,Y Combinator 2026 冬季批次(YC W26)公司 Synthetic Sciences 正式发布开源科研 Agent OpenScience。它能查论文、处理数据、写代码和调用科研数据库,新加入的 Autoresearch 还能让 AI 自己连续跑实验。 比如训练一个模型,研究者只需要告诉它「把验证集 loss 降下来」。OpenScience 会先跑基线,再自己提出修改方案,一轮轮执行实验。结果变好就保留,变差就回退,再根据前面的结果决定下一步试什么。用户也可以提前限制运行次数、总时长和停止条件,或者规定「接下来只改优化器」。 OpenScience 把原本需要研究者反复盯着做的实验迭代自动化了:提出方案、执行实验、比较指标、淘汰失败方案,再继续下一轮。实验可
动察 Beating AI 快讯,Y Combinator 2026 冬季批次(YC W26)公司 Synthetic Sciences 正式发布开源科研 Agent OpenScience。它能查论文、处理数据、写代码和调用科研数据库,新加入的 Autoresearch 还能让 AI 自己连续跑实验。 比如训练一个模型,研究者只需要告诉它「把验证集 loss 降下来」。OpenScience 会先跑基线,再自己提出修改方案,一轮轮执行实验。结果变好就保留,变差就回退,再根据前面的结果决定下一步试什么。用户也可以提前限制运行次数、总时长和停止条件,或者规定「接下来只改优化器」。 OpenScience 把原本需要研究者反复盯着做的实验迭代自动化了:提出方案、执行实验、比较指标、淘汰失败方案,再继续下一轮。实验可以在本机运行,也可以交给远程 GPU、SSH 服务器和 Slurm/PBS 集群。每轮实验的代码、结果和判断都会留下记录,方便后续检查。 它还支持直接登录 ChatGPT/Codex 订阅,也可以接入自己的 API Key、本地模型,或使用官方按量付费的 Ace。 官方自测中,OpenScience 在 70 道 Terminal-Bench Science 任务中完成 53 道,得分 75.7%。作为对比,Codex + GPT-6 Astra 的公开成绩为 68.1%。
查看原始来源 更多内容
来自 Kaka Web3 的公开内容。市场与数字资产信息不构成投资建议。