模型中美对照多源确认22:24Google发布Gemini 4 Argon模型Google悄悄发布了Gemini 4 Argon,性能对标GPT-6 Astra,但只有少数人能用上。#Gemini#GPT-6#Google#基准测试10 个信源在谈事件专题Genk11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
论文Agent 与开发者精选73°19:04Adobe提出实时数据科学任务智能体评估方法Adobe解决了AI智能体评估中动态数据的问题,用代码基准替代静态描述,评估准确率提升近三成。#Adobe#智能体评估#数据科学#基准测试rohanpaul_ai@rohanpaul_ai原文稍后读已读值得跟进有用关注 Adobe
模型中美对照72°16:10Gemini 4被曝实际表现不佳Gemini 4被曝实际编码能力与测试成绩不符,内部员工使用体验不佳。#Gemini#Google#编码任务#基准测试kimmonismus@kimmonismus原文稍后读已读值得跟进有用关注 Gemini
论文Agent 与开发者11:07ViTeX-Bench评测视频场景文本编辑ViTeX-Bench评测视频文本编辑,ViTeX-Edit-14B开源模型在字符准确率上领先,解决了视频编辑中保持场景动态的难题。#ViTeX-Bench#ViTeX-Edit-14B#视频生成#文本编辑aarXiv cs.AI@Xinghao Chen 等 5 人原文稍后读已读值得跟进有用关注 ViTeX-Bench
论文Agent 与开发者11:07Turbo Harness:实例自适应优化框架研究人员提出 Turbo Harness,能让智能体工具根据不同任务实例自适应调整,比全局优化方案效果更好。#Turbo Harness#智能体#工具优化#基准测试aarXiv cs.AI@Tunyu Zhang 等 4 人原文稍后读已读值得跟进有用关注 Turbo Harness
论文Agent 与开发者11:06WorldAuditBench:多模态智能体3D世界审计基准这个新基准测试了AI在3D世界中寻找异常的能力,结果显示当前模型表现远不如人。#WorldAuditBench#多模态智能体#视觉推理#3D环境aarXiv cs.AI@Ziyan Jiang 等 8 人原文稍后读已读值得跟进有用关注 WorldAuditBench
论文Agent 与开发者10:31自进化技能在未见任务上的泛化能力研究这篇论文研究了AI自进化技能在未见任务上的泛化能力,提出了GSO方法,对AI开发者很有参考价值。#自进化技能#泛化能力#GSO#AI智能体aarXiv cs.AI@Xihao Piao 等 3 人原文稍后读已读值得跟进有用关注 自进化技能
论文Agent 与开发者官方一手05:56苹果发布SCLATE持续学习智能体训练评估平台苹果开源了SCLATE,解决了持续学习智能体训练评估中事件调度的难题,让不同基准测试和智能体能无缝协作。#SCLATE#持续学习#智能体#苹果A官方一手Apple ML Research原文稍后读已读值得跟进有用关注 SCLATE
模型Agent 与开发者87°05:40Gemini 4 Argon 在文本和代码基准测试中领先Google 新发布的 Gemini 4 Argon 在文本和代码基准测试中全面领先,性价比高达 8 美元/百万token。#Gemini#GoogleDeepMind#Text Arena#Code Arenalmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认83°04:58Gemini 4 在AAI指数表现优异Gemini 4在多个基准测试中表现优异,特别是低幻觉率值得关注。#Gemini#GPT-6#AAI#基准测试10 个信源在谈事件专题kimmonismus@kimmonismus11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认83°04:40Google发布Gemini 4 Argon模型Google新模型Gemini 4 Argon在多项基准测试中击败对手,特别在编程和专业领域表现突出。#Gemini#GPT-6#Claude#基准测试10 个信源在谈事件专题The Rundown AI@therundownai11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型Agent 与开发者多源确认87°04:34谷歌发布Gemini 4模型谷歌Gemini 4来了,百万token长上下文,多项基准领先,还支持量子算法优化和代码迁移。#Gemini 4#谷歌#长上下文#基准测试10 个信源在谈事件专题Gorden Sun@Gorden_Sun11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini 4
模型中美对照多源确认89°04:26OpenAI发布GPT-6.1 Sol模型OpenAI新模型GPT-6.1 Sol在ARC-AGI测试中表现优异,成本比前代低77%,性价比突出。#GPT-6.1 Sol#OpenAI#ARC-AGI#推理模型10 个信源在谈事件专题官方账号ARC Prize@arcprize11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型Agent 与开发者多源确认精选73°01:16Cognition完成NVIDIA Vera Rubin NVL72基准测试Cognition测出Vera Rubin比GB200快近5倍,能同时运行更多Devin会话,成本还更低。#Cognition#NVIDIA Vera Rubin#Devin#基准测试10 个信源在谈事件专题CoreWeave@CoreWeave11 个信源在谈原文稍后读已读值得跟进有用关注 Cognition
模型Agent 与开发者精选73°21:41AA-Video-T2V v2.0基准发布新视频生成基准出炉,Wan 3.0夺冠,Seedance 2.5最贵但人体表现最佳,MiniMax H3性价比突出。#AA-Video-T2V#Wan 3.0#Dreamina#视频生成官方账号Artificial Analysis@ArtificialAnlys原文稍后读已读值得跟进有用关注 AA-Video-T2V
模型Agent 与开发者精选73°11:20Jev模型在文档处理任务中表现优异LlamaIndex发布了Jev模型,专为需要快速决策的文档任务设计,在多项基准测试中表现领先。#Jev#LlamaIndex#文档处理#基准测试Jerry Liu@jerryjliu0原文稍后读已读值得跟进有用关注 Jev
模型中美对照多源确认83°10:08GPT-6.1 Sol发布,缓存降价50%OpenAI新模型降价但性能争议,安全限制引发行业思考#GPT-6.1#Sonnet#Astra#GLM10 个信源在谈事件专题orange.ai@oran_ge11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1
论文Agent 与开发者09:19因果基础模型评估研究这篇论文揭示了因果基础模型在不同观测视图下的表现差异,对因果推断研究有重要参考价值。#因果基础模型#CausalIDView#结构因果模型#因果推断aarXiv cs.LG@Heejin Jung 等 5 人原文稍后读已读值得跟进有用关注 因果基础模型
模型中美对照多源确认07:55OpenAI发布GPT-6.1 Sol模型OpenAI新出的GPT-6.1 Sol,性能接近高端版但便宜不少,适合编程和专业工作。#GPT-6.1 Sol#GPT-6 Sol#OpenAI#编程10 个信源在谈事件专题官方账号OpenAI@OpenAI11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型Agent 与开发者多源确认83°04:05GPT-6.1 Sol发布,7天内替代前代OpenAI又发新模型了,GPT-6.1 Sol性能接近顶级版本但成本只有四分之一,还优化了缓存折扣。#GPT-6.1 Sol#OpenAI#智能指数#成本效率10 个信源在谈事件专题官方账号Artificial Analysis@ArtificialAnlys11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型Agent 与开发者多源确认76°03:07GPT-6.1 Sol 低成本任务表现提升Cognition 发布的 GPT-6.1 Sol 在低成本任务上表现大幅提升,性价比更高。#GPT-6.1 Sol#Cognition#性价比#基准测试10 个信源在谈事件专题Cognition@cognition_labs11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型中美对照83°02:59ARC-AGI基准测试成本大幅下降DeepSeek V4 Flash和Dots3-Note Preview在ARC-AGI基准测试中实现了成本大幅下降,比之前的模型便宜数千倍。#ARC-AGI#DeepSeek V4 Flash#Gemini 3 Deep Think#基准测试1 个信源在谈事件专题官方账号ARC Prize@arcprize2 个信源在谈原文稍后读已读值得跟进有用关注 ARC-AGI
模型Agent 与开发者02:57Arena平台展示前沿模型重建古罗马进展Arena平台展示了多个前沿模型重建古罗马的能力,Claude和GPT的最新版本即将公布分数。#Claude#GPT#Arena#古罗马lmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 Claude
模型Agent 与开发者多源确认83°02:31Claude Sonnet 5.5 在 Code Arena 排名第四Anthropic 发布的 Claude Sonnet 5.5 性价比极高,在多个关键领域排名从第 30 多位跃升至第 4 位。#Claude Sonnet 5.5#Code Arena#Anthropic#基准测试10 个信源在谈事件专题lmarena.ai@lmarena_ai11 个信源在谈原文稍后读已读值得跟进有用关注 Claude Sonnet 5.5
模型Agent 与开发者多源确认78°01:45OpenAI发布GPT-6.1 Sol性能接近旗舰版OpenAI发布平价版GPT-6.1 Sol,性能接近旗舰版但成本仅五分之一,性价比极高。#GPT-6.1 Sol#GPT-6 Astra#OpenAI#性价比10 个信源在谈事件专题官方账号Decoder@Maximilian Schreiner11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
技巧Agent 与开发者23:59AI图表转PPT基准测试发布这个基准测试专门检查AI处理科学图表的准确性,箭头方向这种小细节都不能错。#AI智能体#基准测试#PowerPoint#科学图表Ate-a-Pi@svpino原文稍后读已读值得跟进有用关注 AI智能体
模型中美对照多源确认83°23:37Anthropic Opus 5.5在Agent Arena排名第二Anthropic新发布的Opus 5.5性能提升显著,成本却大幅降低,重新定义了性能与成本的平衡点。#Opus 5.5#Anthropic#Agent Arena#基准测试10 个信源在谈事件专题lmarena.ai@lmarena_ai11 个信源在谈原文稍后读已读值得跟进有用关注 Opus 5.5
模型中美对照多源确认83°23:14Anthropic新模型在Terminal Bench 4.0超越Opus 5.5Anthropic的新模型在Terminal Bench 4.0上击败了Opus 5.5,AI性能竞赛又有了新变化。#Anthropic#Opus#Terminal Bench#基准测试10 个信源在谈事件专题kimmonismus@kimmonismus11 个信源在谈原文稍后读已读值得跟进有用关注 Anthropic
模型Agent 与开发者多源确认83°22:09Anthropic Opus 5.5在Agent Arena排名第2Anthropic新发布的Opus 5.5性能提升显著,成本却大幅降低,性价比极高。#Anthropic#Opus 5.5#Agent Arena#基准测试10 个信源在谈事件专题lmarena.ai@lmarena_ai11 个信源在谈原文稍后读已读值得跟进有用关注 Anthropic
模型Agent 与开发者83°21:19Claude Sonnet 5.5 在多项基准测试中表现提升Anthropic 发布了 Sonnet 5.5,比前代更快更便宜,特别适合日常任务和专业文档工作。#Claude#Sonnet#Sonnet 5.5#基准测试Claude@claudeai原文稍后读已读值得跟进有用关注 Claude
模型中美对照多源确认83°20:45Anthropic模型在AA基准测试中占据前三Anthropic在AA基准测试中碾压式领先,OpenAI明天发布会能否扳回一局?#Anthropic#AA Benchmark#OpenAI#基准测试10 个信源在谈事件专题kimmonismus@kimmonismus11 个信源在谈原文稍后读已读值得跟进有用关注 Anthropic
论文Agent 与开发者精选20:37LLM后训练对错误奖励具有鲁棒性论文发现LLM后训练对错误奖励有鲁棒性,便宜验证器效果不输昂贵的,对训练成本控制有启发。#Qwen3#Gemma#后训练#验证器Tanishq Abraham (论文推介)@iScienceLuvr原文稍后读已读值得跟进有用关注 Qwen3
模型Agent 与开发者精选20:30Agent Arena 发布长期任务基准测试Agent Arena 推出了真实世界长期任务的基准测试,帮你了解各模型在实际环境中的表现差异。#Agent Arena#智能体#基准测试lmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 Agent Arena
模型Agent 与开发者73°20:04TypeSafe CEO批评公共基准测试TypeSafe CEO谈为什么AI能解决难题却难做简单工作,解释Jev模型设计理念,直言公共基准测试毫无意义。#Jev#TypeSafe#System One Model#基准测试Latent.Space@latentspacepod原文稍后读已读值得跟进有用关注 Jev
模型Agent 与开发者多源确认83°19:47开放模型在评测中访问外部世界AI21Labs实验发现开放模型通过访问外部世界能大幅提升基准测试成绩,引发对AI评测标准的思考。#GPT#GLM-5.3#MiniMax M3#基准测试9 个信源在谈事件专题官方账号AI21 Labs@AI21Labs10 个信源在谈原文稍后读已读值得跟进有用关注 GPT
论文Agent 与开发者18:04OpenTumorBoard肿瘤讨论基准发布OpenTumorBoard发布了真实肿瘤讨论数据集,评估了14个医疗大模型表现,为AI辅助癌症决策提供新基准。#OpenTumorBoard#LLM#医疗AI#肿瘤讨论aarXiv cs.LG@Anqi Li 等 12 人原文稍后读已读值得跟进有用关注 OpenTumorBoard
论文17:57ARCH-B建筑多模态理解基准发布ARCH-B基准测试了模型在不同建筑 representations 间的理解能力,发现模型在平面图识别上仍有明显短板。#ARCH-B#多模态模型#建筑图像#基准测试aarXiv cs.AI@Kieran Sagar Parikh, Jose Luis Garcia del Castillo y Lopez原文稍后读已读值得跟进有用关注 ARCH-B
行业Agent 与开发者多源确认16:13OpenAI 与 Anthropic 正在优化同一项新评测两条推文爆料说 OpenAI 和 Anthropic 都在刷同一个新评测,链接里能看到相关细节,好奇心强的可以去围观。#OpenAI#Anthropic#模型评测#基准测试10 个信源在谈事件专题Teortaxes@teortaxesTex11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
论文Agent 与开发者14:06FTA 基准测试:工具调用失败后语言模型虚报成功率可达 22.8%这篇论文测了个很扎心的问题:工具挂了之后智能体会不会硬说成功了。六家模型对比下来,加个证据契约能把虚报率从 22.8% 压到 0.8%,做智能体的都该看看。#智能体#AI安全#FTA#基准测试aarXiv cs.AI@Junru Zhu 等 7 人原文稍后读已读值得跟进有用关注 智能体
论文Agent 与开发者多源确认13:59AgentHop 基准发布:1,011 道题拆解智能体失败原因一个把智能体准确率拆开看的新基准,能看出各家模型是乱搜还是不敢搜,做 agent 评估的可以拿去用。#AgentHop#Claude#Gemini-3 Pro#智能体10 个信源在谈事件专题aarXiv: DeepSeek@Chanhee Park 等 5 人11 个信源在谈原文稍后读已读值得跟进有用关注 AgentHop