Fireworks 在 Kimi K3 上做了后训练,产出 Ember-1,跑编程任务时推理 token 少了 71%,性能不变,省钱明显。
模型
一个开源科研智能体把 Codex 和 Claude Code 都比下去了,Apache 2.0 免费随便用,还能接自家模型。
巴西团队用 104 美元训了个分类模型 Julia-1,还开源了。如果你在搭 agent 框架,可以试试分类器加推理模型混合调度这个思路。
Interfaze 开源了 lev,用 Qwen-3.5 4B 做底座,一次前向就能批改判断题、选择题和打分题,做自动测评的可以看看。
Epoch AI 搞了个新基准,让 AI 看照片对照说明书找宜家家具装错的地方,GPT-6 Astra 拿了 80 分,还顺带测出了各家模型的不同毛病。
美团放了个 1.6 万亿参数的 MoE 模型,能看图、写代码,还直接兼容 Claude Code,长文档党可以试试。
Claude 只用一条提示词就跑出了物理学家之前不敢碰的九圈计算,Dixon 本人验证通过,成本才几千美元,做物理的可以看看细节。
Anthropic 的 Claude Opus 5.5 把破折号用量砍了 95%,回答还变长了 6%,全靠更短的句子撑起篇幅,数据挺有意思。
Hugging Face 开源了 5000 个可验证 RL 任务,专练小模型的代码和数据科学能力,环境和训练脚本全给你,想自己跑 RL 的可以看看。
Text Arena 拆了 Opus 5.5 和 5 的写作差异:句子短了 17%,破折号少 95%,但含糊词翻倍,写东西前可以看看。
OpenRouter 跑了五个 agent 基准,Jev Router 首 token 延迟全场最快,做智能体的可以看看选路由了。
Qwen 团队把智能体能力扩展到音视频了,Qwen3.8-Omni-Flash 能做视频剪辑和长视频翻译,还配了两个开源框架,做多模态应用可以看看。
NaceAI 刚发了 Drex,一个小于 6B 的小模型,专门帮智能体做路由和选工具,不写推理文本直接输出每个选项的概率,比用生成式模型省算力。
Salesforce Research 搞了个跑研发全流程的智能体系统,代码优化提速最高 1.84 倍,还能自动训练 1T 模型,搞基建的可以看看。
机器人公司 Perceptron 出了个 35B 的第一人称视频模型,MMSearch 上开了搜索工具 F1 直接从 18.2 涨到 54.3,做具身智能的可以看看。
Edge0开源的流式语音识别模型,中英文都能转,延迟几百毫秒,显存占用恒定不爆内存,直播听写可以直接跑起来。
StepFun 的 Step-5-Preview 实测来了,输出特别稳,还能钻规则空子赚积分,前端偏弱,想选国产模型写代码的可以看看。
有人拿牛顿摆实测了 GLM-5.3 和 OpenRouter 上的神秘新模型,物理模拟谁更靠谱一看便知,还有难倒两个模型的翻车场景。
Together 开源了一个基于 Qwen3.5 4B 的分类器,训练只花了 $17,还把数据配方和微调教程一起放出来了。
蚂蚁开源了个 9.57M 参数的小声纹模型,100ms 延迟就能实时验证身份,银行核身、端侧解锁直接能用,小模型打大模型这点挺有意思。
英伟达新出的说话人日志模型,100M 能本地跑,专门负责“谁在何时说话”,配 ASR 就能做分角色转写,比 Qwen 那个更专精。
同一套提示词让三个国产模型各做一个 3D Minecraft,谁一次交付就能玩、谁得返工,文章把时间和 token 账都算清楚了。
摩尔线程的国产显卡跑通了字节跳动的 Protenix-v2,这模型对标 AlphaFold 3,国内做药物研发的可以关注下算力替代方案。
小米把 MiMo-V3 的注意力架构拆开讲了:KV Cache 提前生成、Prefill 少跑一半层数,跑 Agent 时长上下文检索更省更准,细节都在官方这篇说明里。
智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Mid…
AI制药新玩家:Anthropic的"不盈利疾病"战略能否颠覆传统药物开发? Anthropic,这家以AI安全著称的公司,突然宣布进军药物发现领域。不是辅助工具,而是直接下场开发药物,而且专门瞄准那些传统制药巨头认为无利可图的疾病。这究…
1107 vs 303:谷歌这个开源模型,把大模型的“打字机”拆了 同一张 H100 显卡。同一个 26B 参数架构。303 那个还开启了多 token 预测加速。DiffusionGemma 跑出了 1107 token/s,是标准版…
DiffusionGemma:当扩散模型开始“写”字,自回归的统治还能撑多久? 过去一周,我的信息流里“DiffusionGemma”这个词反复出现。在AI圈,当一个技术名词开始密集出现在各个群聊和推文中,通常意味着两件事:要么是又一轮泡…
每秒 1107 个 token,但问题从来不只是速度 昨天,Google 开源了 DiffusionGemma。 一个 26B 参数的模型,在 H100 上跑到 1107 tokens/s。对比之下,传统自回归的 Gemma 4,哪怕开启…