18:03官方账号深度求索 DeepSeek@deepseek_ai78°DeepSeek-V4-Flash-Vision-Exp模型在DeepSeek API平台上线,文本能力与DeepSeek-V4-Flash相当,多模态性能提升显著,接近Opus-4.8。DeepSeek Harness 0.1.1版本支持新模型。AI模型DeepSeek-V4-Flash-Vision-Exp多模态推理模型1 个信源在谈事件专题推荐理由:DeepSeek新模型上线,文本和推理能力提升,多模态性能接近Opus-4.8,值得一试!原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-Vision-Exp
02:57官方账号Perplexity@perplexity_aiGrok 4.6 已在 Perplexity 和 Perplexity Computer 上线。该模型在 WANDR 基准上位于性能和效率的帕累托前沿。相比 Fable 5,Grok 4.6 在结果持平的情况下成本降低超过 60%。用户现在即可在 Perplexity 生态中直接使用 Grok 4.6。AI模型Grok 4.6PerplexityWANDR6 个信源在谈事件专题推荐理由:Grok 4.6 上线 Perplexity 了,在 WANDR 上跟 Fable 5 结果持平,成本还低 60% 以上。原文稍后读已读值得跟进有用关注 Grok 4.6
13:09Ethan Mollick@emollickEmollick 指出,GPT-5.6 Pro(仅通过聊天机器人可用)是当前最智能的模型。GPT-5.6 Ultra(Codex 中的最佳模型)在困难任务上表现不如 Pro。对于极难问题,性能排序为 GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。这一命名体系让用户难以区分。AI模型GPT-5.6 ProGPT-5.6 UltraFable 5 Ultracode1 个信源在谈事件专题推荐理由:Emollick 实测对比了 GPT-5.6 系列和 Fable 5,告诉你哪个版本才是真正的推理之王,别再被名字骗了。原文稍后读已读值得跟进有用关注 GPT-5.6 Pro
10:30Ethan Mollick@emollickAI模型性能存在异常波动现象,有些模型(如Updated Sonnet 3.5,即Sonnet 3.6)相比前代出现显著性能跳升,但后续模型往往回落到平均水平。这一现象在历史数据中多次出现,例如Sonnet 3.6相较于之前的模型有异常提升,而后续版本则回归常规表现。这表明模型性能进步不总是线性递增,存在随机性或特定优化带来的短期优势。行业Sonnet 3.5Sonnet 3.6模型性能推荐理由:来看看AI模型性能的诡异规律:Sonnet 3.6为什么突然那么强,后续又掉回去了?挺有意思的行业观察。原文稍后读已读值得跟进有用关注 Sonnet 3.5
07:09官方账号Greg Brockman@gdbOpenAI CEO Sam Altman在X平台表示,他们的模型旨在为每项任务提供最低价格,并邀请用户分享在其他模型上获得更好价格/性能的工作负载细节。该推文获得1687次点赞和152117次浏览,引发行业对模型定价策略的讨论。Altman还提供了个人邮箱供用户联系。行业OpenAISam Altman定价策略10 个信源在谈事件专题推荐理由:Sam Altman发推说OpenAI模型定价最优,不服来比。想了解OpenAI怎么看待价格战?看看吧。原文稍后读已读值得跟进有用关注 OpenAI
14:42官方一手歸藏(guizang.ai)@op7418Notion官方在状态页面公开指出Anthropic的Opus 4.7和4.8模型出现性能下降,导致用户使用Notion AI时失败率升高。为缓解影响,Notion已禁用所有Anthropic模型并将请求路由到其他供应商。Anthropic回应称此类问题在所有模型中都会发生,目前性能已恢复。但观察者指出,Anthropic模型出问题的频率明显高于其他两家,其状态页面甚至显示可用性未达99%。AI产品AnthropicOpus 4.7Opus 4.810 个信源在谈事件专题推荐理由:Anthropic模型频繁出问题,做AI产品集成的团队需要评估供应商稳定性——Notion的公开点名就是信号,建议关注Anthropic的可用性记录再决定是否深度依赖。原文稍后读已读值得跟进有用关注 Anthropic
07:44Mustafa Suleyman@mustafasuleymanMustafa Suleyman 引用 ArtificialAnalysis 的图表指出,MAI-Transcribe-1 在语音转录性能上远超其他模型,处于独立领先地位。该模型在准确率和效率上表现突出,可能重新定义语音转录的标准。这对于依赖语音转文字服务的开发者和企业来说是一个重要信号,意味着更高质量和更低延迟的转录体验。AI模型MAI-Transcribe-1语音转录模型性能推荐理由:语音转录是许多 AI 应用的基础,MAI-Transcribe-1 的突破意味着做语音助手、会议记录或字幕生成的团队可以直接获得更优方案,值得关注。原文稍后读已读值得跟进有用关注 MAI-Transcribe-1
08:25cat@_catwuAnthropic 正在招聘一位专注于模型性能的产品经理,负责 Claude Code 产品线。该职位要求候选人具备编写智能体评估(agentic evals)的经验,并能将研究想法整合到核心产品中。这表明 Anthropic 正加速将前沿研究转化为实际产品,尤其关注智能体(Agent)场景下的模型表现。对于关注 AI 产品化和智能体落地的从业者,这是一个值得关注的信号。行业Claude Code产品经理智能体评估10 个信源在谈事件专题推荐理由:Anthropic 首次公开为 Claude Code 招聘模型性能方向的 PM,说明智能体评估正从研究走向产品化。做 AI 产品经理或智能体开发的团队,可以从中看到行业对 agentic evals 的重视程度,值得关注。原文稍后读已读值得跟进有用关注 Claude Code
05:36官方账号Anthropic@AnthropicAIAnthropic 在 X 上发布更正声明,指出 Claude Opus 4 的约 3 倍平均速度提升是从 2025 年 5 月开始的,而非之前误称的 2024 年 5 月。该评估自 2024 年 9 月才存在,但他们对更早模型进行了回溯测试,发现 2024 年 5 月的模型没有任何加速。这一修正澄清了 Claude Opus 4 性能提升的时间线,对关注模型迭代速度的开发者有参考价值。AI模型Claude Opus 4Anthropic模型性能10 个信源在谈事件专题推荐理由:Anthropic 主动修正了 Claude Opus 4 性能提升的时间点,做模型选型或依赖速度指标的开发者需要更新认知,建议关注官方后续的详细评估。原文稍后读已读值得跟进有用关注 Claude Opus 4