UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。
OpenAI 自研芯片发布,AI 加速与模型创新齐飞
2026年6月24日,AI 领域迎来多项突破。OpenAI 发布首款自研推理芯片 Jalapeño,为 ChatGPT 等工作负载优化,能效显著提升,计划年底吉瓦级部署。在模型加速方面,SGLang 配合 DeepSeek-V4 在 GB300 上实现 5 倍吞吐量提升,DFlash 投机解码在 Blackwell 上达到 15 倍加速,大幅降低推理成本。同时,阿里巴巴千问 发布 Qwen-AgentWorld,首个原生语言世界模型,可模拟文本和 GUI 环境覆盖七大领域,为智能体交互提供新范式。今日共 183 条新闻,AI 硬件、加速与模型创新齐头并进。
模型发布/更新
5 篇OpenAI 和 Broadcom 联手搞了颗推理芯片 Jalapeño,9 个月就流片了,能效比现在最好的还强,计划 2026 年底大规模部署,想自己掌控底层硬件。
产品发布/更新
5 篇Hermes Agent 现在能用 /learn 自动生成技能文件,省去手写 SKILL.md 的麻烦,试试看。
Hugging Face 悄悄把存储和流式传输做到极致,机器人数据从1千到6万,GPU跑满1326 MB/s,不闲置了。
行业动态
5 篇论文研究
5 篇这个新基准EG-VQA把视频问答的答案和证据绑定在一起,测出来一大票模型只会蒙答案不会找证据。开源模型EG-Reasoner靠证据监督训练,反事实推理直接碾压好几家专有模型。
技巧与观点
5 篇AWS这篇博文手把手教你用Bedrock AgentCore做多租户,共享底层资源又能隔离租户数据,适合医疗等SaaS场景,比自己折腾省心多了。
Codex官方写了10个手机上用Remote的实战技巧,比如用Steer纠偏、手机做Code Review,比单纯盯进度实用多了。想远程开发效率翻倍可以看看。
想可视化你Python项目的代码结构?这个教程教你用Graphify和NetworkX离线搞定,还能找出上帝节点和社区。
LangChain 创始人手把手教你如何迭代改进智能体,从构建到上线再到优化,全是实操干货,适合所有做 AI Agent 的团队。