全部动态
小米三款 MiMo-V2.6 上线了,Pro 主打编程智能体,UltraSpeed 版输出快 10 倍,都在 OpenRouter 能调。
jev 这类新决策模型有了开源平替,SemIf 基于 Qwen3.5,本周 LangSmith Gateway 免费用。
xAI 的 Grok 4.7 便宜但跑分只有 46,比 Claude 和 GPT-6 各低 7 分,预算敏感的场景可以看看。
Claude 现在主导 Anthropic 26% 的研发任务,2 月还不到 1%,还配了 3 万个 Agent 一起干活。
阿里 Qwen 出了个 7B 的图像模型,生成和编辑一个 checkpoint 搞定,还能塞 10 张参考图,浏览器里就能直接玩。
Qwen-Image 2.1 一张 4090 就能跑,18.7 秒出图还带透明底输出,SGLang 当天就给出了部署命令。
NemotronLabs 开源了全双工语音模型 VoiceChat,能边聊边调工具,被打断也接得住,做语音智能体的可以看看。
这个 PARTS 框架挺有意思,就是针对机器人执行长时程任务时,那些容易卡壳的关键步骤,用强化学习去专门训练,效果比单纯用预训练策略好很多,而且需要的人类操作也少。
朋友,有个新模型叫 GraphSkillEvo,它用图结构来优化大语言模型的技能,效果比之前的 SkillOpt 好一些,在 GPT-5.4-nano 上提升了 4.01%。
想了解游戏开发中 AI 生成软件的性能?这个新基准测试集 GameASG-Bench 很有用,它有 47 个具体任务和详细的实验数据,能帮你判断不同模型的效果。
朋友,Cognition 团队开源了一个叫 Kev 的小型决策模型,基于 Qwen3,你可以自己训练和本地部署,对消费级硬件很友好。
朋友,青海师范大学的藏语智能实验室发布了我国首款藏语多语言全模态 AI 输入法,叫智达 AI 输入法,支持手机、电脑全终端,还能语音输入藏语,挺方便的。
朋友A测试了OpenAI的GPT-6 Astra玩《我的世界》,发现它遇到意外后居然会像人一样陷入消沉,连续种土豆,这个现象挺有意思的。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档