8月21日
18:03
18:03官方账号深度求索 DeepSeek@deepseek_ai
78°
DeepSeek-V4-Flash-Vision-Exp模型在DeepSeek API平台上线,文本能力与DeepSeek-V4-Flash相当,多模态性能提升显著,接近Opus-4.8。DeepSeek Harness 0.1.1版本支持新模型。
事件专题

推荐理由:DeepSeek新模型上线,文本和推理能力提升,多模态性能接近Opus-4.8,值得一试!
8月14日
02:57
02:57官方账号Perplexity@perplexity_ai
Grok 4.6 已在 Perplexity 和 Perplexity Computer 上线。该模型在 WANDR 基准上位于性能和效率的帕累托前沿。相比 Fable 5,Grok 4.6 在结果持平的情况下成本降低超过 60%。用户现在即可在 Perplexity 生态中直接使用 Grok 4.6。
事件专题

推荐理由:Grok 4.6 上线 Perplexity 了,在 WANDR 上跟 Fable 5 结果持平,成本还低 60% 以上。
6月8日
6月6日
07:44
6月5日
08:25
08:25cat@_catwu
Anthropic 正在招聘一位专注于模型性能的产品经理,负责 Claude Code 产品线。该职位要求候选人具备编写智能体评估(agentic evals)的经验,并能将研究想法整合到核心产品中。这表明 Anthropic 正加速将前沿研究转化为实际产品,尤其关注智能体(Agent)场景下的模型表现。对于关注 AI 产品化和智能体落地的从业者,这是一个值得关注的信号。
事件专题

推荐理由:Anthropic 首次公开为 Claude Code 招聘模型性能方向的 PM,说明智能体评估正从研究走向产品化。做 AI 产品经理或智能体开发的团队,可以从中看到行业对 agentic evals 的重视程度,值得关注。