全部动态

AI 相关资讯全量信息流 · 1231 条
6月8日
产品多源确认精选10:58
让 Claude Opus 长时自主运行的 5 条核心实战建议

Boris Cherny 的 5 条建议直击长时自主运行的痛点,做自动化任务编排的开发者可以直接套用到 Codex 或 GPT-5.5 上,尤其是端到端自我验证这条能帮你省下大量无效 token 消耗,值得收藏实践。

事件专题
shao__meng@shao__meng4 个信源在谈原文
技巧Agent 与开发者多源确认09:47
不写 Prompt,写 Loops — Boris Cherny (Claude Code)

Boris Cherny 点出了 AI 编程范式的转变——从手写 Prompt 到写 Loops,做自动化任务的开发者值得思考这个方向。但 Token 消耗的现实提醒你:企业场景下仍需平衡自主性与成本,建议点开看具体怎么落地。

事件专题
shao__meng@shao__meng11 个信源在谈原文
6月7日
6月6日
Agent Arena 发布真实世界智能体排行榜,GPT-5.5 High 领先

做智能体开发和评测的团队终于有了一个贴近真实工作场景的排行榜——Agent Arena 用 30 万+ 任务和 200 万+ 工具调用数据,告诉你哪个模型在写代码、做研究、处理文档时真正靠谱,值得点开看看你的模型排第几。

事件专题
rohanpaul_ai@rohanpaul_ai2 个信源在谈原文
6月5日
6月4日
论文精选12:09
Discourse-Role Labels 影响语言模型对上下文的采纳程度

这篇论文揭示了标签选择能显著改变模型对误导信息的采纳率(最高差 84 个百分点),做 RAG 系统或上下文增强应用的开发者需要警惕:你用的标签可能无意中放大了错误信息的影响。建议点开了解如何控制这一变量。

arXiv: DeepSeek@Jianguo Zhu原文
6月3日
模型Agent 与开发者多源确认88°13:48
微软发布7款MAI新模型,MAI-Thinking-1对标Sonnet 4.6

微软一口气推出7款新模型,覆盖推理、编程、图像三大方向,MAI-Thinking-1在推理和编码上直接对标Claude Sonnet 4.6和Opus 4.6,做AI应用或企业定制化模型的团队值得关注——尤其是Frontier Tuning让企业用更低成本获得超越GPT-5.5的效果。

事件专题
Mustafa Suleyman@mustafasuleyman6 个信源在谈原文
6月2日
论文12:05
K-BrowseComp:首个韩语网页浏览智能体基准测试

做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。

事件专题
arXiv: DeepSeek@Nahyun Lee 等 15 人2 个信源在谈原文