一篇讲 agent 记忆管理的论文,用 RL 学出策略在“查现成记忆”和“现整理原始历史”之间动态切换,还能按成本和延迟偏好调,实验跑在五个多模态基准上。
#多模态
GUI 智能体缺训练数据的老问题,这篇用图像编辑模型自己造数据,Qwen3-VL 微调后 AndroidWorld 成绩还涨了不少,代码开源可以直接试。
研究员做了 Knossos 基准加 Ariadne 框架,让 VLM 能把流程图、架构图完整转成节点和边组成的图,代码开源可试。
苹果把 Apple Intelligence 塞进电视了,新 Apple TV 4K 传 10 月 13 日就发,还能在电视上回消息。
Reka AI 用 320 块 H100 三个月训出 19B 的 Rho-1,文本图像视频加机器人控制一个模型全包,算力开销比主流大模型小得多。
有人在单张 RTX 5090 上跑 Qwen3-Omni,用 AWQ-4bit 把首音频延迟从 213ms 压到 23ms,本地语音对话流畅度差了近十倍。
Black Forest Labs 新出的 FLUX 3 Image 能框选局部改图,周围画面不动,还能用 JSON 坐标控排版,做海报的可以试试
一个把 AI 推理和湿实验闭环起来的抗体发现系统,110 个候选里 60 个真中和,还顺带找到了 bnAb 的细胞来源,免疫学背景的读者别错过。
NVIDIA把PixelUMM开源了,一个模型搞定图文视频的理解和生成,做法是不用视觉编码器直接吃像素块,搞多模态研究的可以看看源码。
有人让 Opus 5.5 全程自主做了一部 36 分钟的光学史科普片,配音、配乐、画面全是模型自己调的工具,花了 200 多美元,过程很值得看。
连常批评 OpenAI 的博主都服了:GPT 操作 Safari 像真人,任务独立完成几乎零失误,可以看看实测细节。
Google 把 Gemini 分档收紧了,免费党只剩 Flash-lite 能用,Pro 模型锁进付费档。10 月 9 日生效,看看你那档还能用啥。
微软把实时转写做到榜单第一了:2.5% 词错率、延迟 0.12 秒左右,支持 60 种语言,每小时 0.54 美元,Foundry 上能直接试用。
有人拿 GPT-6 Astra 把拿破仑一封 217 年没人读懂的密信破解了,6 小时搞定符号识别加密码分析,过程细节都在文里。
MiniMax 去纽约广告周摆摊了,现场能玩 H3,还拉上 Krea 和 fal 聊生成工具,在附近可以去 booth A16E 看看。
ElevenLabs 把自家语音合成做成了 Reader 应用,三端都能用,长文章懒得看可以直接听。