#模型性能
共 26 条 · 7 天 1 条 · 30 天 7 条
信息流里打上「模型性能」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
10月2日
10月1日
9月29日
9月17日
9月3日
上下文窗口越长越好?8B 模型学会整理记忆后,32K 打败 128K 自己
清华大学等机构的研究框架ContextPilot,通过主动管理上下文,让8B模型在长文档问答和深度搜索任务上表现出色,优于128K窗口的原始模型。
9月2日
9月1日
8月27日
8月26日
Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining
这篇论文揭示了有效学习率在语言模型预训练中的关键作用,通过分析ELR与损失动态的关系,为优化预训练过程提供了新的视角。与传统的学习率相比,ELR提供了更精确的控制,有助于提高模型性能。
8月24日
8月21日
8月14日
Grok 4.6 登陆 Perplexity 和 Perplexity Computer
Grok 4.6 上线 Perplexity 了,在 WANDR 上跟 Fable 5 结果持平,成本还低 60% 以上。
7月24日
7月20日
7月16日
6月8日
Notion点名Anthropic Opus 4.7/4.8性能下降,已恢复
Anthropic模型频繁出问题,做AI产品集成的团队需要评估供应商稳定性——Notion的公开点名就是信号,建议关注Anthropic的可用性记录再决定是否深度依赖。
6月6日
模型07:44
MAI-Transcribe-1 在语音转录领域遥遥领先语音转录是许多 AI 应用的基础,MAI-Transcribe-1 的突破意味着做语音助手、会议记录或字幕生成的团队可以直接获得更优方案,值得关注。
6月5日
Anthropic 招聘 Claude Code PM,专注模型性能与智能体评估
Anthropic 首次公开为 Claude Code 招聘模型性能方向的 PM,说明智能体评估正从研究走向产品化。做 AI 产品经理或智能体开发的团队,可以从中看到行业对 agentic evals 的重视程度,值得关注。
Anthropic 更正:Claude Opus 4 的 3 倍加速始于 2025 年 5 月
Anthropic 主动修正了 Claude Opus 4 性能提升的时间点,做模型选型或依赖速度指标的开发者需要更新认知,建议关注官方后续的详细评估。