精选 AI 资讯 · AI 热点

6月24日

16:09

16:09

berryxia@berryxia

精选

Anthropic内部工程师运行300多个自改进的agent swarm来提升系统可靠性。核心方法是给模型验证自身输出的机制，包括计划模式、动态工作流和自我检查，根据真实反馈迭代。这种闭环系统让agent从一次性工具变为能自我迭代的系统，可靠性大幅提升但token消耗更高。效果远超大多数300美元的agent课程。

技巧 Anthropic 智能体 agent 工作流自改进

推荐理由：Anthropic工程师自己怎么用agent？300个自改进swarm加闭环验证，比花300美元买课实用多了。

6月16日

13:48

13:48

AlphaSignal@AlphaSignalAI

精选

SIA论文提出将智能体视为可编辑系统，更新目标包括工具、解析器、验证器和权重。在LawBench基准上达到70.1%准确率。其CUDA内核运行仅1,017微秒，去噪任务mse_norm为0.289。论文提供公开仓库，支持选择聚焦于工具链或权重。核心结论是自改进智能体的性能取决于验证器质量。

论文 SIA LawBench 智能体自改进验证器

推荐理由：这篇SIA讲一个让智能体自己改进的方法，不只调提示，还能改工具和权重，在LawBench上做到了70.1%，代码也开源了。

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

6月1日

00:09

AITOP6月1日 00:09

OpenAI 发起“Codex for Open Source”：免费赠送 6 个月 Pro 订阅，开源维护者能否迎来 AI 变革？

5月29日

08:02

AITOP5月29日 08:02

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？🔥Anthropic 把 AI 编程的“确认键”彻底删掉了！Claude Code 搭载全新 Opus 4.8 模型，长时间任务不跑偏、不废话、不中断，像一个资深工程师一样默默干活，从功能开发到漏洞清扫全包圆，你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”，现在它直接交完整交付物……自主编程的最后一层窗户纸，被捅破了。做自动化开发和代码审查的团队，这个模型建议直接上手，效率差距肉眼可见……

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？