精选 AI 资讯 · AI 热点

6月13日

13:13

13:13

Together AI@togethercompute

精选

Together AI的Rish Bhargava在推文中指出，部署语音智能体时延迟超过500ms用户会注意到，超过1秒用户会挂断。他详细分析了整个管道，包括75ms网络延迟为何增加30%开销，以及通过共置所有组件可将延迟降至5ms。推文附有链接，可能提供更深入的技术细节。

技巧语音智能体延迟优化 Together AI 网络延迟共置部署

推荐理由：语音智能体延迟优化实战

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

6月4日

11:02

11:02

arXiv cs.AI@Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen

精选76°

多智能体推理系统通常采用“先生成再传输”的范式，导致端到端延迟随流水线深度线性增长。StreamMA 提出流式方案，每个推理步骤生成后立即流式传输给下游智能体，实现流水线并行，显著降低延迟。令人意外的是，这种流水线还提升了效果：因为多步推理质量不均匀，早期步骤更可靠，使用早期步骤而非完整链条可防止错误后期步骤误导下游智能体。在数学、科学和代码等八个推理基准上，StreamMA 平均提升 7.3 个百分点，最高提升 22.4 个百分点。研究还发现了“步骤级缩放定律”：增加每个智能体的步骤数能同时提升效果和效率，这是一个与智能体数量缩放正交的新维度。

论文多智能体推理系统流式通信延迟优化缩放定律

推荐理由：做多智能体系统或推理管线的开发者，StreamMA 用流式通信同时解决了延迟和效果问题，值得直接参考实现思路。

6月1日

00:09

AITOP6月1日 00:09

OpenAI 发起“Codex for Open Source”：免费赠送 6 个月 Pro 订阅，开源维护者能否迎来 AI 变革？

5月29日

08:02

AITOP5月29日 08:02

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？🔥Anthropic 把 AI 编程的“确认键”彻底删掉了！Claude Code 搭载全新 Opus 4.8 模型，长时间任务不跑偏、不废话、不中断，像一个资深工程师一样默默干活，从功能开发到漏洞清扫全包圆，你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”，现在它直接交完整交付物……自主编程的最后一层窗户纸，被捅破了。做自动化开发和代码审查的团队，这个模型建议直接上手，效率差距肉眼可见……

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？

5月28日

17:17

17:17

marktechpost@Asif Razzaq

精选72°

Perplexity AI 开源了其重写的 Unigram 分词器，该分词器在 p50 延迟上比 Hugging Face tokenizers crate 低 5 倍，同时将生产环境的 CPU 利用率降低了 5-6 倍。这一改进主要针对重排序器（reranker）的延迟瓶颈，通过优化分词效率来提升整体推理性能。开源版本已在 GitHub 上发布，可供开发者直接使用。对于依赖大规模文本处理的 AI 团队来说，这能显著降低计算成本并加快响应速度。

AI模型分词器开源/仓库 Perplexity AI 延迟优化推理加速

推荐理由：做搜索或 RAG 系统的团队终于有了更快的分词方案——Perplexity 开源的这个 Unigram 分词器直接降低 5 倍延迟和 6 倍 CPU 消耗，建议有高吞吐需求的开发者立刻试一下。