10:17官方一手arXiv: Anthropic@Nikita Khudov研究团队发布OenoBench,一个包含3266道选择题的葡萄酒领域知识评测基准。该基准基于38104个原子事实构建,涵盖六个支柱和四个难度层级。评估16个前沿模型配置,发现整体准确率在53%-84%之间,o3以83.6%领先。DeepSeek R1在推理模式下提升6.8个百分点,而Claude Opus和Gemini Pro无提升。Anthropic在自身问题上偏好度+9pp,Google则-8pp。开源模型与专有推理模型共享成本-准确率帕累托前沿。所有配置在闭卷可解项目上平均提升33pp。论文OenoBencho3DeepSeek R110 个信源在谈事件专题推荐理由:研究人员搞了个叫OenoBench的葡萄酒知识测试题库,用这个题库测了16个大模型,发现o3考得最好,DeepSeek R1在推理题上表现突出,还发现模型对自己出的题有偏好,挺有意思的。原文稍后读已读值得跟进有用关注 OenoBench
06:04lmarena.ai@lmarena_ai精选72°GLM-5.2 (Max)在LMArena的Code Arena: Frontend榜单排名第2,位列开源模型第1。该模型比Claude Opus 4.7 (Thinking)高出29分,仅次于Fable 5。其在React子榜单排名第2,HTML子榜单排名第4,并在Brand & Marketing、Data & Analytics等6个子类别中排名第一。智谱AI(Zai_org)披露下一代GLM即将发布。AI模型GLM-5.2智谱Claude Opus推荐理由:智谱新出的GLM-5.2 (Max)在前端代码测评里拿了开源第一,总分第2,把Claude Opus 4.7甩开29分。写前端的可以关注下。原文稍后读已读值得跟进有用关注 GLM-5.2
10:27宝玉@dotey精选作者分享了用Claude Opus生成PPT的经验,对比了HTML+CSS和SVG路线,认为HTML是最佳中间格式。baoyu-design skill可用Opus模型1:1还原PPTX,美观度优于GPT-5.6。成本方面,非大量制作时差异不大,重点在效果。业界多数产品选择HTML/CSS或操作PPT软件包,而remio设计了精炼直观的IR并实现往返高保真,效率比Claude Code快一两倍、成本低2/3。技巧Claude Opusbaoyu-designremio推荐理由:作者做了两个PPT skill,经验很实在。他说Claude Opus做HTML比GPT好看,还对比了不同路线的优劣势,想省成本又出效果可以看看。原文稍后读已读值得跟进有用关注 Claude Opus
11:36IT之家(博客/媒体)77°Anthropic 将 Claude Opus 和 Sonnet 模型纳入语音模式,此前仅 Haiku 支持语音对话。Sonnet 和 Opus 专为复杂问题设计,能给出深入回答并执行任务,例如将对话整理成推介方案或重新安排日历行程。语音模式新增支持法语、德语、西班牙语等 9 种语言。用户可在同一对话中自由切换文字与语音,也能随时更换模型。AI产品Claude OpusSonnetAnthropic10 个信源在谈事件专题推荐理由:Anthropic 这次把 Opus 和 Sonnet 的语音模式开了,以前只有 Haiku 能用,现在能跟更强的模型聊复杂问题,还能让它帮你整理方案、改行程,支持多国语言,挺实用的。原文稍后读已读值得跟进有用关注 Claude Opus
04:35Claude@claudeaiClaude的语音对话功能现在可以使用更多现有聊天模型,包括Claude Opus和Sonnet。用户可以在对话中途调用已连接的工具,如邮箱和日历。这一更新提升了语音交互的灵活性和实用性。推文发布于X平台,获得244次点赞和33次分享。AI产品ClaudeClaude OpusSonnet1 个信源在谈事件专题推荐理由:Claude语音现在能用Opus和Sonnet模型,还能中途调工具,发邮件查日历更顺手了。原文稍后读已读值得跟进有用关注 Claude
16:51宝玉@dotey精选作者分享了一套用Claude Design设计UI/UX(输出HTML+CSS+React+data.js),再交给Claude Opus 4.8实现MVP的开发模式。设计稿可提交git并diff追踪变更,Opus 4.8在UI实现上优于GPT 5.5。为解决Claude Desktop功能不足,作者将Claude Design本地化集成到Codex和Cursor中,通过分析Claude Code前端代码实现了本地运行的Skill,效果与在线版一致。技巧Claude DesignClaude OpusCodex7 个信源在谈事件专题推荐理由:作者用Claude Design做UI设计,Opus 4.8写代码,还教你怎么把整套流程搬到本地集成到Cursor里,省去网页切换的麻烦。原文稍后读已读值得跟进有用关注 Claude Design
12:16AI Will@FinanceYF5Kimi K3 Max在Kimi内部知识工作基准上获得三项得分:Online Exp Bench 75.5分,DECK-Bench 73.5分,Finance-Bench 62.6分。这些基准测试模拟真实用户Agent工作流中的常见任务。三项成绩均超过Claude Opus 4.8(max)和GPT-5.5(xhigh)。这表明Kimi K3 Max在Agentic知识工作上的能力和可靠性有所提升。AI模型Kimi K3 MaxClaude OpusGPT-5.52 个信源在谈事件专题推荐理由:Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。原文稍后读已读值得跟进有用关注 Kimi K3 Max
07:57官方账号Simon Willison’s Weblog(博客/媒体)Puter项目将Firefox(Gecko引擎)编译为WebAssembly,使其能在另一个浏览器内完整运行。该工程使用了Claude Opus和Fable(Claude Max订阅计划),消耗约$25,000的token。演示通过Wisp协议将流量经Puter服务器代理,支持端到端加密(已验证HTTPS流量加密)。代码已开源于firefox-wasm仓库,类似项目WebkitWasm编译WebKit但暂无在线演示。AI产品FirefoxWebAssemblyPuter2 个信源在谈事件专题推荐理由:有人把整个Firefox编译成了WebAssembly,能在Chrome里跑另一个浏览器,用Claude辅助编程才搞定的,超级酷。原文稍后读已读值得跟进有用关注 Firefox
23:24向阳乔木@vista8Simon Willison提出在Claude系统提示词中加入规则,让模型自动根据编码任务复杂程度选择不同功耗的模型。主架构设计等复杂任务使用Claude Opus或Fable,而写代码、改代码等机械任务则调用Sonnet或Haiku子代理执行。该方法通过区分判断型与执行型任务来降低API调用成本,实测可节省大量费用。该思路同样适用于其他多模型平台。技巧ClaudeFableClaude Opus推荐理由:想省API预算又不想牺牲架构质量?试试这个:让Claude Opus/Fable做主设计,Sonnet/Haiku干苦力,自动分配任务,省心又省钱。原文稍后读已读值得跟进有用关注 Claude
11:26官方账号arXiv cs.AI@Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard, Francisco J. Rodriguez-Martinez, Lorena Otero-Cerdeira该研究评估了GPT、Claude Opus、Gemini和GLM四个大语言模型在短Linux/bash命令回答评分中的表现。采用四级认知分类(L1信息检索至L4高级系统管理),在1200个真实学生回答上与三位专家评分对比。Gemini 3.0 Pro配合rubric引导提示达到最高一致性(ICC(3,1)=0.888,MAE=0.10)。一致性随认知层级上升而下降,提示质量比模型选择影响更大。该框架可确定哪些问题适合AI辅助评分。论文LLMGeminiClaude Opus1 个信源在谈事件专题推荐理由:想用AI批改Linux命令作业?试试Gemini 3.0 Pro加评分rubric,人机一致性高达0.888。原文稍后读已读值得跟进有用关注 LLM
16:48小互@imxiaohu用户用Best.XiaoHu.AI内容测试了Sonnet 5、4.6和Opus。Sonnet 5在文字和翻译任务上比4.6有明显提升,但前端设计、交互和SVG能力远不如Opus。用Sonnet 5替代文字翻译可节省约一半输入token,速度提升1倍多。翻译成本量级下降约80%,质量零损失。AI模型Sonnet 5Sonnet 4.6Claude Opus4 个信源在谈事件专题推荐理由:网友实测Sonnet 5翻译超省:成本降80%、速度翻倍,但前端别指望它。原文稍后读已读值得跟进有用关注 Sonnet 5
23:10berryxia@berryxia精选Anthropic工程师Margot Van Laar在Code with Claude分享提示词工程最佳实践,强调通过评估(Eval)而非直接修改提示词来优化。她用客服机器人和零售排班两个案例演示:使用XML标签结构化提示词、移除旧模型遗留的禁止列表(如Claude 3 Opus)、用工具替代指令处理计算任务。拆解复杂任务为生成-评估-修复循环,并建议用更强推理模型(如Opus)加自适应思考替代小模型复杂提示词。技巧提示词工程Claude评估10 个信源在谈事件专题推荐理由:Anthropic工程师手把手教你怎么调客服提示词和搭Agent,用Opus加循环拆解比堆复杂指令更管用,核心就一句话:先搞评估原文稍后读已读值得跟进有用关注 提示词工程
21:24Geek@geekbb精选DAO-C是基于DeepSeek V4的终端编码agent,在7个真实开源bug-fix任务上总成本仅¥1.07。相比Claude Opus,费用降低约30倍。其成本优势源于前缀缓存聚合,命中率达95.8%。该工具在编码效率上媲美Claude Code。AI产品DeepSeek V4Claude CodeClaude Opus推荐理由:这个基于DeepSeek V4的终端agent超省钱,修7个bug才1块零7分,比Claude Opus便宜30倍,编码体验还接近Claude Code。原文稍后读已读值得跟进有用关注 DeepSeek V4
10:24官方一手arXiv: OpenAI@Moran Koren该论文提出一种以验证为先的LLM辅助经济理论协议,并实例化为三种方法:单次严谨通道、对抗性验证器对(Claude Opus 4.8提议,OpenAI Codex反驳,作者仲裁)以及带评审门控的结构化多智能体项目。作者在一个开放示例——为Gans-Kominers等级膨胀模型设计Groves/Pigouvian激励相容机制——上评估该协议,三个运行均未产生严格直接揭示VCG/Clarke机制,对抗性通道自身证实了该点。结果揭示三个反复出现的现象:收敛发现、对抗验证的有效性、以及抛光不等于严谨。论文LLM经济理论验证协议10 个信源在谈事件专题推荐理由:这篇论文为你演示了如何用LLM做经济理论研究,重点不是让模型生成答案,而是设计验证流程来确保结果可靠,三种方法对比很清楚。原文稍后读已读值得跟进有用关注 LLM
02:43官方账号SiliconFlowAI@siliconflowaiGLM-5.2 在 Designarena 的 HTML Web Design 排行榜上取得第一,超越了此前长期占据榜首的 Claude Opus 4.6 和 4.7。该模型已通过 SiliconFlow API 提供使用。开发者可以立即调用 GLM-5.2 构建 HTML 网页设计项目。AI模型GLM-5.2Claude OpusSiliconFlow1 个信源在谈事件专题推荐理由:HTML 设计排行榜上 GLM-5.2 干掉了 Claude,现在就能用 SiliconFlow 的 API 上手,写网页贼快。原文稍后读已读值得跟进有用关注 GLM-5.2
08:30Ate-a-Pi@svpino推文作者Santiago分享了他的7款最爱模型:日常用Claude Opus 4.7和ChatGPT 5.5 Thinking、实时新闻用Grok、编程用Claude Code(Sonnet 4.6和Opus 4.6)、本地快速用Gemma 4、开放权重用MiniMax 2.7和Qwen 3.6。他还推荐了Anuma作为一站式替代方案,支持跨模型共享上下文和并排对比答案。AI产品Claude OpusChatGPTGrok1 个信源在谈事件专题推荐理由:有人列出了7款主流模型推荐,还发现Anuma能跨模型保持对话、对比答案,省订阅费。原文稍后读已读值得跟进有用关注 Claude Opus
01:55官方账号Decoder@Jonathan Kemper精选智谱AI推出开源模型GLM-5.2,采用MIT许可证,支持稳定100万token上下文。在FrontierSWE编码基准测试中,GLM-5.2以1个百分点之差落后于Anthropic的Claude Opus 4.8。该模型在推理能力上仍显著落后于闭源竞争对手。AI模型GLM-5.2智谱AIClaude Opus10 个信源在谈事件专题推荐理由:智谱AI的GLM-5.2在长时间编码任务上只比Claude Opus 4.8差1%,还是开源免费,码农可以试试。原文稍后读已读值得跟进有用关注 GLM-5.2
03:45Guillermo Rauch@rauchgAnthropic 的 Mythos 安全验证工具对 Malte Ubl 的 just-bash 项目进行了安全审计,结果未发现严重问题。just-bash 是一个完整的 bash 实现,包含 QuickJS、CPython 和可选文件系统访问,攻击面很大。该项目大部分代码由 Claude Opus 4.5 编写,仅经过最少的人工审查,但通过深度加固循环和机器强制编码规则保证了安全性。这一案例展示了 AI 生成代码在严格安全约束下可以达到的可靠性。AI产品Claude OpusMythos安全验证10 个信源在谈事件专题推荐理由:AI 写代码的安全性问题一直让人担心,这个案例证明只要加固流程到位,AI 生成的复杂系统也能通过专业审计。做 AI 安全或代码生成的团队值得看看他们的方法论。原文稍后读已读值得跟进有用关注 Claude Opus
01:18elvis@omarsar0Boris Cherny 分享了让 Claude Opus 自主运行数小时甚至数天的 5 个实用技巧。核心要点包括:使用自动模式避免频繁请求批准、利用动态工作流让 Claude 协调数百/数千个智能体、通过 /goal 或 /loop 命令持续推动任务完成、在云端运行 Claude Code 以便随时关闭笔记本、以及确保 Claude 能端到端自我验证工作成果。这些技巧对于需要长时间自主运行 AI 智能体的开发者非常实用。技巧Claude Opus自主运行智能体3 个信源在谈事件专题推荐理由:做长时间自主 AI 智能体的开发者终于有了实操指南——这 5 个技巧直接解决「怎么让模型持续干活不卡壳」的痛点,建议做自动化任务的团队点开抄作业。原文稍后读已读值得跟进有用关注 Claude Opus
11:35rohanpaul_ai@rohanpaul_ai精选72°斯坦福、MIT、NVIDIA、Google 等顶尖实验室联合发布 AutoLab 基准测试,包含 36 个任务,要求智能体从弱代码出发,在固定时间内改进。测试 17 个强模型后发现,最佳结果并非源于初始想法好,而是模型持续测试、利用反馈。Claude Opus 4.6 因坚持迭代而领先,其他前沿模型常因过早放弃或过度思考而失败。该研究揭示了当前 AI 智能体在长周期研究中的关键短板。论文智能体基准测试长周期研究10 个信源在谈事件专题推荐理由:做 AI 研究和智能体开发的团队会看到,坚持比聪明更重要——AutoLab 的发现直接点出了当前智能体在长任务中的致命弱点,值得反思自己的智能体设计。原文稍后读已读值得跟进有用关注 智能体
10:58shao__meng@shao__meng精选Claude Code 作者 Boris Cherny 分享了让 Claude Opus 持续运行数小时甚至数天的 5 条实战建议,包括启用自动权限模式、使用动态工作流编排子 Agent、通过 /goal 或 /loop 指令推动任务完成、优先使用云端版本避免本地关机中断,以及确保端到端自我验证能力。这些建议同样适用于 Codex、GPT-5.5 等其他模型,核心在于减少人工干预、提升任务连续性和验证有效性。对于需要长时间自主执行复杂任务的开发者来说,这些技巧能显著提升效率并避免 token 浪费。AI产品Claude OpusClaude Code自主运行3 个信源在谈事件专题推荐理由:Boris Cherny 的 5 条建议直击长时自主运行的痛点,做自动化任务编排的开发者可以直接套用到 Codex 或 GPT-5.5 上,尤其是端到端自我验证这条能帮你省下大量无效 token 消耗,值得收藏实践。原文稍后读已读值得跟进有用关注 Claude Opus
05:21rohanpaul_ai@rohanpaul_ai72°Datacurve 推出 DeepSWE,一个更严格的编程基准测试,旨在揭示领先模型之间的真实差距。GPT-5.5 得分 70%,而 GPT-5.4 为 56%,Claude Opus 4.7 为 54%,差距在旧基准中常被掩盖。DeepSWE 使用原创任务而非公开 GitHub 问题,避免模型训练时见过答案。其提示词长度仅为 SWE-bench Pro 的一半,但解决方案需要 5.5 倍代码量和约 2 倍输出 token。评分方式也不同,DeepSWE 检查请求行为是否真正实现,而非仅依赖合并 PR 的测试。AI模型基准测试编程能力GPT-5.51 个信源在谈事件专题推荐理由:做 AI 模型评估或选型的团队,DeepSWE 能帮你看到模型在长周期软件工程任务上的真实差距,建议关注这个新基准。原文稍后读已读值得跟进有用关注 基准测试
17:59Philipp Schmid@_philschmid72°DeepSWE 是一个新的软件工程/智能体基准测试,包含 113 个任务,覆盖 91 个仓库和 5 种编程语言。其评估框架 mini-swe-agent 为每个模型提供单一的 bash 工具和相同的系统指令,没有厂商自定义原语。评估提示比 SWE-Bench Pro 更短,但平均需要修改 5.5 倍以上的代码和 7 个文件,旨在模拟开发者与智能体对话的真实方式。初步结果显示,Claude Opus 比 Claude Code 高 10 个百分点,Gemini 3.1 Pro 比 Gemini CLI 高 20 个百分点。该基准强调指令遵循能力,可能对探索型模型不利。AI模型SWE 基准智能体编程助手1 个信源在谈事件专题推荐理由:做 SWE 智能体评估或开发 AI 编程助手的团队,这个新基准更贴近真实开发场景,值得关注其设计思路和模型表现差异。原文稍后读已读值得跟进有用关注 SWE 基准
12:33官方一手Claude: Blog(资讯)精选Claude Opus 是Anthropic最新旗舰模型,在MMLU基准测试中达到90.2%,在HumanEval代码生成测试中达到90.1%,均超越GPT-4。它支持200K token上下文窗口,在复杂推理、多语言对话和编程等任务上表现领先。该模型采用Constitutional AI训练方法,提升了安全性和可控性。AI模型Claude OpusAnthropicMMLU10 个信源在谈事件专题推荐理由:推理编程都碾压,性价比高原文稍后读已读值得跟进有用关注 Claude Opus