Together 开源了一个基于 Qwen3.5 4B 的分类器,训练只花了 $17,还把数据配方和微调教程一起放出来了。
全部动态
OpenAI 拉了 80 多位心理医生做了个心理健康对话基准,GPT-6 Astra 考了 57.3 分,GPT-4o 只有 32.1,想看模型心理对话靠谱程度可以关注这套评测。
Anthropic 让 949 个 Claude 智能体自己跑 21 小时,扫了 19 亿蛋白簇,真挖出一个类似 CRISPR 的新酶系统,AI 做科研这回是真落地了。
Google 官宣 Gemini 4 进入 post-training 了,初步版本很快就来,盯着 OpenAI 那边的朋友可以对照看看进度。
Anthropic 让约 950 个 Claude 智能体跑 21 小时,自己从 DNA 数据库里挖出一个类似 CRISPR 的新酶系统,还做了湿实验验证,很科幻的一条。
一个才 9.7 MB 的小适配器,挂在 Bonsai 2 27B 上就能去掉拒绝回答,MMLU 几乎不掉分,16 GB 的 MacBook 也能跑。
Zenith 用最便宜的 DeepSeek v4.1 Flash 打赢了 GPT 5.6 Sol,开源党可以看看它怎么做到的。
Google 出了两款新 TTS 模型,Gemini 3.8 Flash TTS 主打表现力,做配音或语音交互的可以上 AI Studio 先试试效果。
蚂蚁开源了个 9.57M 参数的小声纹模型,100ms 延迟就能实时验证身份,银行核身、端侧解锁直接能用,小模型打大模型这点挺有意思。
英伟达新出的说话人日志模型,100M 能本地跑,专门负责“谁在何时说话”,配 ASR 就能做分角色转写,比 Qwen 那个更专精。
一位博主聊 Opus 5.5 的使用感受:提示词可以写得越来越简单了,模型自己就会干活,原来靠第三方技能补的事模型直接包办。
同一套提示词让三个国产模型各做一个 3D Minecraft,谁一次交付就能玩、谁得返工,文章把时间和 token 账都算清楚了。
Anthropic 新的 Claude Opus 5.5 (Max) 在 Code Arena 编程榜拿了第一,价格还比 GPT-6 Astra 便宜 60%,写代码的可以看看实测视频。
摩尔线程的国产显卡跑通了字节跳动的 Protenix-v2,这模型对标 AlphaFold 3,国内做药物研发的可以关注下算力替代方案。
DeepMind 新掌门首次开口,说 Gemini 4 就在打磨阶段了,之前一直被 OpenAI 压着打的 Google 这次要追分了。
小米把 MiMo-V3 的注意力架构拆开讲了:KV Cache 提前生成、Prefill 少跑一半层数,跑 Agent 时长上下文检索更省更准,细节都在官方这篇说明里。
摩尔线程用 MTT S5000 跑具身 RL,训练曲线和主流 GPU 相关性 0.976,双臂装配成功率 92%,国产卡跑机器人训练又多了个实测数据点。
OpenAI 拿出 1215 段心理对话让各家模型答题,GPT-6 Astra 拿 57.3% 第一,Gemini 2.5 Pro 只有 29.5%,数据集已开放下载。
Gemini 3.5 Pro 跳票后谷歌直接憋了个 Gemini 4,已经进入后训练阶段,年底前就能见到,内部员工还拿它跑编程工具了。
Anthropic 让 950 个 Claude 智能体跑了 21 小时,真在基因数据库里挖出一个类似 CRISPR 的新酶系统,流程用的还是公开发布的 Claude Science 和 Claude Code。
AI 眼镜不用联网也能识图问答了,1-bit 量化让 2B 模型塞进眼镜芯片,速度翻倍、功耗还降,端侧玩法的实用参考。
阿里达摩院的新模型用普通平扫 CT 就能查出早期食管癌,不用插管,敏感性 90%,还发在了《自然·医学》上,做医疗影像的值得看看细节。
月之暗面的 Kimi K3.1 曝光了,会有 Low/High/Max 三档推理和 Swarm 多智能体协作,10 月见分晓。
一位前 TikTok 推荐算法工程师拆解了 JEV 这个新范式,还拿 500 篇 ECCV 论文的查询任务和 Claude 打了个平手,做推荐搜索的值得看看。
Anthropic 让 950 个 Claude Agent 跑了 21 小时分析噬菌体 DNA,还真找到一个类似 CRISPR 的未知酶系统,科学研究玩法变了。
Anthropic 的 Claude 派出 950 个智能体跑了 21 小时,在噬菌体 DNA 里找到人类漏掉的类 CRISPR 酶系统,有点意思。
Anthropic 的 Claude Opus 5.5 (Max) 在 LMArena 拿下第一,混合价才 $16 每百万 token,性价比曲线被改写了。
Anthropic 新发的 Claude Opus 5.5 直接拿下 Code Arena 网页开发榜第一,比 Opus 5 高出 126 分,跑任务成本还降了 40%。
Google 的 Gemini 4 据说要这两天就发,The Information 爆料的,感兴趣的可以先蹲一下官方消息。
小米 MiMo 团队搞了个新注意力架构,1M 上下文时 prefill 计算量和 KV cache 都砍到原来的几分之一,长文检索分数还涨了,做长上下文部署的可以看看论文。
商汤的 SenseNova U1 Pro 图像模型上线了,走交错式思维链生成,最高能出 8K 分辨率图,Raccoon 应用和 API 都能用。
有人拿 Claude Opus 5.5 加 Three.js 做了个演示,随手画的草图直接生成四阶段演进的 3D 房屋,做前端的可以看看思路。
OpenAI 新出的 GPT-6 Sol 和 Luna 便宜了一半,Sol 跑分还超过了 Claude Opus 5,做大批量任务可以认真看看这个定价。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档