6月5日
00:30
00:30Fireworks AI@FireworksAI_HQ
76°
NVIDIA 的 Nemotron 3 Ultra 模型已在 Fireworks 平台上线,这是一款面向前沿推理和长时间运行自主智能体编排的开源模型。该模型专为编码智能体、深度研究和复杂企业工作流等场景设计,旨在提升 AI 在长周期任务中的自主决策与执行能力。Fireworks 提供了零日支持,开发者可立即使用。
事件专题

推荐理由:做复杂自动化智能体的团队终于有了开源推理模型的新选择——Nemotron 3 Ultra 专为长任务编排优化,编码和深度研究场景的开发者可以直接上手试。
6月4日
23:01
23:01官方账号阶跃星辰 Stepfun@Stepfun_AI
阶跃星辰的 Step 3.7 Flash 模型已在 Fireworks AI 平台上线。该模型从设计之初就针对推理优化,采用硬件友好的架构和 MTP 辅助解码技术,推理速度可达每秒 400 tokens。Step 3.7 Flash 支持多模态输入,适合在真实工作流中驱动智能体。这一发布为开发者提供了高性能、低延迟的模型选择,尤其适合需要快速响应的应用场景。
事件专题

推荐理由:Step 3.7 Flash 以 400 tokens/s 的速度刷新了推理效率,做实时 AI 应用或智能体开发的团队可以直接在 Fireworks AI 上试用,省去自建推理基础设施的麻烦。
13:01
13:01官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
StepFun 发布 Step 3.7 Flash 模型,主打高智能与高速度的平衡。该模型采用 MTP 辅助解码技术,输出速度超过 400 tokens/s,具备更强的智能体性能和原生多模态能力。模型权重以 Apache 2.0 协议开源,适合生产级智能体工作负载。独立评测者 @ArtificialAnlys 对其进行了详细评估。
推荐理由:做智能体应用或需要高吞吐推理的团队,Step 3.7 Flash 的开源高速度方案值得直接拿来用,尤其适合生产环境部署。
00:31
00:31官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 模型专为真实世界的智能体编程任务设计,不仅追求代码生成速度,更注重在复杂输出中保持逻辑、视觉和执行的一致性。该模型在演示中展示了其在多步骤、多模态任务中的连贯性,适合需要高可靠性的编程场景。开发者 @atomic_chat_hq 的创意测试进一步验证了其能力。
推荐理由:做智能体编程的开发者终于有了一个兼顾速度和一致性的模型——Step 3.7 Flash 在复杂任务中保持逻辑连贯,值得在真实项目中试试。
6月3日
19:16
19:16官方账号Decoder@Maximilian Schreiner
83°
在Build 2026大会上,微软发布了7款自研AI模型,包括其首个推理模型。微软还推出了一种新的调优方法和一个自主后台智能体。在图像生成方面,微软声称超越了谷歌,但在推理能力上仍在追赶。这些模型和工具旨在增强Azure AI平台,为开发者提供更强大的AI构建能力。微软的自主后台智能体可以自动执行后台任务,提高效率。

推荐理由:微软一口气推出7款自研模型,图像生成能力超越谷歌,但推理模型仍在追赶——做AI应用开发的团队值得关注这些新工具,尤其是新的调优方法和自主后台智能体,可以直接提升项目效率。
10:47
10:47官方账号arXiv cs.AI@Areeb Gani, Asal Meskin, Gabrielle Kaili-May Liu, Arman Cohan
精选
该研究提出一个系统框架,用于量化大型推理模型(LRM)在输出长链思维时,其内在置信度与语言表达置信度之间的对齐程度(即忠实校准FC)。研究发现,LRM的推理行为并不会自动提升FC,且针对非推理模型的提示干预在推理场景中无效。不同置信度估计器对同一推理轨迹给出分歧评估,暴露了现有评估方法的脆弱性。这项工作将FC确立为LRM在高风险部署场景下的关键可靠性与对齐目标。
推荐理由:LRM的推理链常被用户视为深思熟虑的证据,但这项研究戳破了这个幻觉——推理行为并不等于置信度表达更可靠。做模型对齐或安全评估的团队值得关注,尤其是那些在医疗、金融等高风险场景部署LRM的开发者,看完会重新审视你的置信度校准策略。
10:27
10:27官方账号arXiv cs.AI@Yu Xia, Zhouhang Xie, Xin Xu, Byungkyu Kang, Prarit Lamba, Xiang Gao, Julian McAuley
精选72°
ACTS提出了一种新方法,通过智能体控制器自适应地引导冻结的推理模型,在推理过程中动态调整思考策略和预算,从而在保持生成连续性的同时大幅节省token。该方法将推理引导建模为马尔可夫决策过程,控制器根据推理轨迹和剩余预算发出策略动作。实验表明,ACTS在全思考性能下实现了显著的token节省,并支持不同推理器和任务间的可控精度-效率权衡。代码已开源。
推荐理由:ACTS解决了LLM推理中token浪费和缺乏控制的问题,做推理优化或部署大模型的开发者可以直接用开源代码尝试,实现更经济的推理。
08:37
08:37Fireworks AI@FireworksAI_HQ
微软 MAI 模型即将在 Fireworks 平台上架,提供可控的智能和可追溯的端到端数据链。企业用户可针对自身任务对 MAI 推理模型进行微调,使用自己的数据构建定制化模型。这标志着微软将企业级 AI 能力进一步开放给开发者,Fireworks 作为高性能推理平台,将加速 MAI 模型的落地应用。

推荐理由:企业 AI 团队终于有了可定制的推理模型——MAI 支持端到端数据溯源和私有微调,做企业级 AI 应用的开发者可以直接在 Fireworks 上尝试,省去自建基础设施的麻烦。
01:14
01:14OpenRouter@OpenRouterAI
DigitalOcean 的 AI-Native Cloud 现已作为新供应商接入 OpenRouter 平台,提供高性能推理服务。该服务支持多种热门开源模型,在 DeepSeek V3.2 模型上输出速度和延迟均排名第一,数据由 Artificial Analysis 验证。开发者可通过 OpenRouter 直接调用这些模型,获得更快的响应体验。

推荐理由:做 AI 应用开发或需要快速推理的团队,现在可以在 OpenRouter 上直接使用 DigitalOcean 的高性能云服务,DeepSeek V3.2 的速度优势值得一试。
6月2日
22:55
22:55官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 是一款面向快速智能体编码的开源权重模型,支持可靠工具调用和多模态理解。该模型已从模型卡片阶段进入实际编码工作流,由 @kilocode 团队在博客中详细介绍。其设计重点在于提升智能体编码效率,适合开发者集成到自动化编程任务中。这一进展标志着开源模型在实用化方面迈出重要一步。
推荐理由:做智能体编码的开发者终于有了一个可直接使用的开源模型——Step 3.7 Flash 的可靠工具调用和多模态能力能显著提升自动化效率,建议点开博客了解具体集成方式。
10:36
10:36Skywork@Skywork_ai
88°
Anthropic 最新模型 Claude Opus 4.8 已在 Skywork 平台上线。该模型在判断力和推理能力上有显著提升,能够处理更复杂的任务。Skywork 用户现在可以直接使用该模型进行对话和推理。这标志着 Anthropic 在 AI 模型能力上的持续进步。
事件专题

推荐理由:Claude Opus 4.8 的更强推理能力对需要高精度判断的开发者(如代码审查、逻辑分析)是直接利好,Skywork 用户现在就能体验,建议试试。