Edge0开源的流式语音识别模型,中英文都能转,延迟几百毫秒,显存占用恒定不爆内存,直播听写可以直接跑起来。
全部动态
有人用 Opus 5.5 把植物大战僵尸 2 全部 880 关做成 3D 版,Three.js 加 Blender,耗了 4000 万 token,评论里能直接玩。
humynlabs 出了个语音识别新基准,专测真实对话和混语言场景,23 个模型已上榜,做语音方向的可以拿来自测。
DeepSeek 和智谱都出了 Flash 版本,看来各家都在学 Google 那套分级打法,DeepSeek 可能还要出 Pro 和 Ultra。
有人扒到智谱 GLM-5.5 Flash、GLM-5.4 和 Kimi K4 的命名线索,猜 K4 激活参数比 K3 还少,吃瓜看看。
StepFun 的 Step-5-Preview 实测来了,输出特别稳,还能钻规则空子赚积分,前端偏弱,想选国产模型写代码的可以看看。
xAI 的 Grok 4.7 上 Agent Arena 榜了,任务成功率明显变好,但单任务价格从 $0.74 涨到 $1.14,省钱党可以先观望。
一个从 Codex 全家桶跳回 Anthropic 的用户聊 Opus 5.5 的实际手感:精准、快、不啰嗦,和现在 X 上的舆论风向。
Odyssey 的 Agora-2 能让最多20个人和 AI 进同一个 AI 实时生成的世界,靠看《暗黑破坏神 II》录像学会规则,思路挺特别。
有人拿 Claude Opus 5.5 设计乐高 Microduck,1113 个零件全验证零碰撞,连搭建手册和 BrickLink 订单都备好了。
Stanford 联合 Terminal-Bench 团队搞了个科研智能体榜单,70 个真实科研任务里 GPT-6 Astra 拿 63% 排第一,开源模型才 10%,差距很直观。
Justin Johnson 讲了 World Labs 怎么生成能反复进入的 3D 世界,跟一般视频生成不一样,还能用来训机器人。
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜模型,Luna 编码榜涨了 74 分,API 价格还砍了一半,跑批量任务可以看看。
有人把多个模型混着调用,30 个智能体任务测下来追平 GPT-6 Astra,成本只要 1/3,混合路由这事有数据了。
写老代码的人该看看:Factory 的 Legacy-Bench 进了 Fireworks 的指数,专门测模型会不会修祖传代码。
AMD 拿 1000 多张 MI355X 跑 MXFP8 预训练,还会讲 TorchAO 和 TorchTitan 的具体调优细节,搞训练的可以听听。
OpenCode 里能免费用一周的神秘模型 Space Bunny,看图就能写代码,做 3D 原型还自己开浏览器检查效果,搞前端和创意编程的可以试试。
Odyssey 的 Agora-2 能在一个共享实时世界里同时模拟 20 个人和 AI 智能体,还显式追踪彼此影响,比单智能体模拟更贴近真实多人博弈场景。
博主 berryxia 爆料 Google 这几天可能放出 Nano Banana 2.5,还吐槽它只敢发 flash 和 Lite,不敢上 Pro 版。
Cline 里免费用 Gemini 3.8 Flash,1M 上下文加 291 tok/s,跑分还压过 GPT-5.6 Luna 和 DeepSeek v4.1 Flash,写代码可以直接试。
Odyssey 出的 Agora-2 能让 20 个人和智能体进同一个实时模拟环境,可以拿来训练机器人或研究智能体合谋,预览版已经能玩。
做自定义 harness 的可以看看 CLM-8B,比 Jev 快 9 倍,DeepSWE 跑到 81.6%,代码和模型都开源了。
Xiaomi 新发的 MiMo-V2.6-Pro 在 AA 指数上拿到 46 分,只差 GPT-5.6 一分,成本却只要零头,权重还是 MIT 开源的。
Latent.Space 访了 Jev 的创造者,聊这个专门在软件里做可靠决策的模型为什么故意不走聊天路线,还吐槽公开基准,观点挺反主流的。
有人拿 DeepSeek V4.1 Flash 和 Space Bunny Alpha 现场比拼,让两个模型各自写一个网页版 Minecraft,前者能跑能挖,后者地面还有破洞,结果一目了然。
有人专门做了个家具组装基准,测模型空间推理,10个月分数从28%飙到80%,连以前模型搞不定的活也开始拿下了。
Kimi K3 在 TPU 上跑到 709 tokens/s,比 GB200 还快,92 个 MoE 层塞进一个 Pallas kernel,做法挺巧,做推理的可以看看。
Anthropic 的 Opus 5.5 在编程智能体评测拿第一,三项基准都涨了,价格还降了 20%,不过每任务要烧 13 美元 tokens,用前算算账。
蚂蚁 inclusionAI 开源了个专做 UI 和海报的文生图模型,6B 参数还支持透明背景,设计出图可以试试。
Anthropic 让 950 个 Claude 智能体跑了 21 小时,在 20 万个 DNA 样本里找到一个类似 CRISPR 的新酶系统 ART,张锋也点了头。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档