OpenAI搞了个新基准LifeSciBench,专门测生物科学推理,GPT-Rosalind比GPT-5.5还强,值得看看。
全部动态
AI 相关资讯全量信息流 · 1231 条
6月18日
LifeSciBench基准发布,GPT-Rosalind超越GPT-5.5
6月17日
论文10:30
TAC基准测试:AI旅行代理会预订斗牛吗?前沿模型隐含动物福利评估动物福利问题有了AI专属的代理基准TAC,实测Claude Opus 4.7刚过一半,加个提示词能暴增60%,暴露了模型在实际行动中的盲区。
NVIDIA GEAR 发布 ENPIRE:AI 编程 agent 自主操控真实机器人做实验
NVIDIA 和 CMU 搞了个能自己跑实验的机器人系统,AI agent 操控真实机器人干活,成功率99%,还开源了。
6月16日
OpenRouter推出Fusion API,多模型协同以一半成本接近Claude Fable 5水平
OpenRouter用多个便宜模型拼出顶级效果,成本砍半但性能追上Claude Fable 5,预算有限又想用好模型可以试试。
谷歌更新 Android Bench 榜单:Gemini 3.5 Flash 成本最贵,约 DeepSeek V4 Flash 的 17.5 倍
谷歌新榜单实测,Gemini 3.5 Flash 在安卓开发任务中得分低、成本高,性价比远不如 DeepSeek V4 Flash。
Cua与Snorkel AI发布Cua-Bench:评测Agent在KiCad上的Computer Use能力
想看看AI Agent在专业软件上到底行不行?Cua-Bench用KiCad的25道真实任务给模型打分,最强的也只过了6道,从零建电路全挂。看完你就知道瓶颈在哪了。
Claude Fable 5 在 Epoch Capabilities Index 上以 161 分超越 GPT-5.5 Pro
Claude Fable 5 刚在 Epoch 能力指数上以 161 分微弱领先 GPT-5.5 Pro,这是 Anthropic 一年多来首次登顶,你可以看看它具体强在哪。
Agentic AI生成并行Julia代码的可扩展性研究
这篇论文测试了GPT-5.5、Claude Opus 4.7和Qwen3-Coder-Next用智能体写并行Julia代码,在超算上跑192核,发现小规模还行,大规模容易死锁或OOM,开源模型最差。做HPC或Julia并行开发的人值得看。
datasette-agent 0.3a0 新增 execute_write_sql 工具,需用户批准写数据库
Simon Willison 发布的 datasette-agent 新版本让你可以安全地用自然语言操作数据库,写操作需要你点头,还能用 --unsafe 一键自动批准,适合快速原型。
6月15日
6月14日
6月13日