10:17官方一手arXiv: Anthropic@Nikita Khudov研究团队发布OenoBench,一个包含3266道选择题的葡萄酒领域知识评测基准。该基准基于38104个原子事实构建,涵盖六个支柱和四个难度层级。评估16个前沿模型配置,发现整体准确率在53%-84%之间,o3以83.6%领先。DeepSeek R1在推理模式下提升6.8个百分点,而Claude Opus和Gemini Pro无提升。Anthropic在自身问题上偏好度+9pp,Google则-8pp。开源模型与专有推理模型共享成本-准确率帕累托前沿。所有配置在闭卷可解项目上平均提升33pp。论文OenoBencho3DeepSeek R110 个信源在谈事件专题推荐理由:研究人员搞了个叫OenoBench的葡萄酒知识测试题库,用这个题库测了16个大模型,发现o3考得最好,DeepSeek R1在推理题上表现突出,还发现模型对自己出的题有偏好,挺有意思的。原文稍后读已读值得跟进有用关注 OenoBench
22:38官方账号LangChain@LangChainAIGoogle 推出了 Gemini Pro 新版本,该版本在多模态任务上实现更优表现,在 Image Captioning 基准上达 98% 准确率,是其多模态模型能力的重大更新AI模型Gemini ProGoogleImage Captioning推荐理由:和同学说:Google 推出 Gemini Pro 这个版本,多模态方面表现好,和旧版比提升明显,值得看看原文稍后读已读值得跟进有用关注 Gemini Pro
03:00Fireworks AI@FireworksAI_HQ精选Heidi团队不再租用第三方模型,选择微调一个开源模型。在内部评估中,该模型质量超越Gemini Pro。延迟从25秒降至7秒,速度提升3.5倍。从概念验证到生产部署仅用4周。AI模型HeidiGemini Pro微调推荐理由:Heidi自己微调开源模型,质量居然比Gemini Pro还好,速度还快了3.5倍,4周就上线,太强了。原文稍后读已读值得跟进有用关注 Heidi
02:04techcrunch@Rebecca Bellan76°Anthropic推出Claude Sonnet 5,具备更强的智能体能力。其定价低于Opus、GPT-5.5和Gemini Pro。模型在安全性上也有所改进。该定位旨在提供更经济的AI代理运行方案。AI模型Claude Sonnet 5AnthropicGPT-5.510 个信源在谈事件专题推荐理由:Anthropic出了Claude Sonnet 5,便宜又能跑智能体,比GPT-5.5和Opus都划算。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
11:38官方一手arXiv: OpenAI@Marta Vallejo, Siwen Wang该研究通过十名参与者观看33张安全风险场景图像的眼动数据,生成人口平均注视热图。使用GPT-4o通过OpenAI Vision API生成视觉注意力显著性图,并与注视数据比较。空间对齐评估采用四个指标:皮尔逊相关系数0.515±0.117、NSS 0.988±0.323、KL散度1.766±0.844、AUC-Judd 0.806±0.076。与Gemini Pro、Gemini Flash和Claude的对比显示,所有模型AUC-Judd超过机会基线0.5且NSS为正。Gemini Pro在三个指标上定位最强,GPT-4o在KL散度上分布匹配最佳。论文GPT-4oGemini ProGemini Flash10 个信源在谈事件专题推荐理由:想知道AI能不能像人一样在危险场景下抓住关键区域?这篇论文用GPT-4o、Gemini Pro等模型做了对比,发现它们不靠眼动训练数据就能大致预测人类注视点。原文稍后读已读值得跟进有用关注 GPT-4o
17:59Philipp Schmid@_philschmid72°DeepSWE 是一个新的软件工程/智能体基准测试,包含 113 个任务,覆盖 91 个仓库和 5 种编程语言。其评估框架 mini-swe-agent 为每个模型提供单一的 bash 工具和相同的系统指令,没有厂商自定义原语。评估提示比 SWE-Bench Pro 更短,但平均需要修改 5.5 倍以上的代码和 7 个文件,旨在模拟开发者与智能体对话的真实方式。初步结果显示,Claude Opus 比 Claude Code 高 10 个百分点,Gemini 3.1 Pro 比 Gemini CLI 高 20 个百分点。该基准强调指令遵循能力,可能对探索型模型不利。AI模型SWE 基准智能体编程助手1 个信源在谈事件专题推荐理由:做 SWE 智能体评估或开发 AI 编程助手的团队,这个新基准更贴近真实开发场景,值得关注其设计思路和模型表现差异。原文稍后读已读值得跟进有用关注 SWE 基准