谷歌新出的Gemini 3.8 Live和Extended Thinking,能一边说话一边思考,比如查资料时能同步汇报进度,比普通语音助手更智能。
#多模态
谷歌发布了Gemini 3.8 Live和Extended Thinking功能,前者在人工分析质量指数上达到82.6分(第一),后者能后台思考并异步调用工具。Gemini 3.8 Live的输入成本为每分钟0.005美元,输出成本为每分钟0.018美元,在τ-banking代理任务完成度上达到35.1分(第一)。
研究团队提出了OptiFlow框架,通过最优传输学习离线强化学习中的多模态一步流策略,解决了标准方法导致模式坍塌或过估计偏差的问题,实验效果不错。
想了解多模型 agent 如何协作?这篇文章讲了用 claude 当 leader,协调 codex、gemini 等成员写代码,还提到了冗余和选举机制,挺实用的。
Reward AI 新发布的 OM-1 模型很特别,它直接从人类操作数据里学习,不用遥操作,部署到不同机器人上都不用微调,能大幅降低机器人训练门槛。
谷歌新出的Dreambeans,能帮你把Gmail、日历这些数据串起来,根据你的朋友信息生成专属故事和礼物建议,比单纯看信息流更个性化。
朋友,GPT-Image 2.5 新增了视频指令功能,现在你可以直接对着视频说‘帮我调整一下光线’,它就能自动处理,比之前只能处理图片的版本更方便。
朋友,@novita_labs 的 Ling 3.0 Flash VL 模型现在在 OpenRouter 上可用,它是一个 124B 的模型,能处理图像和视频,还支持工具调用,比很多其他模型更强大。
朋友,Recraft AI 这个工具很实用,能帮你把文字描述变成图片,比如你写‘一个留着巨大尖刺头发的朋克,肩膀扛着个大西瓜’,它就能直接生成对应的图片,比用普通AI绘画工具更方便。
这篇论文研究的是如何用AI模型更准确地预测血糖,对糖尿病患者管理很有用。他们测试了Chronos-Bolt模型,发现微调后效果比直接用好很多,还结合了饮食数据,能更精准地预测餐后血糖变化。
朋友,这篇论文挺有意思的,它专门测试了GPT-5.1、Qwen-3-Max和DeepSeek-3.1这三个大模型在生成乌尔都语故事时的表现,发现它们在文化方面确实很弱。
DeepSeek 新出的 V4.1 Flash 模型,用不对称 MoE 架构,参数量 552B,但只用了 8B 活跃参数处理输入、16B 处理输出,比上一代节省了 3/4 的存储,算力效率更高,还支持多模态,价格也便宜,适合需要高效推理的场景。
Deepseek 新出的 V4.1-Flash 模型,参数量 5520 亿,内存占用比之前少四分之三,还比 GPT-5.6 Sol 和 Opus 5 表现好一点,适合做更便宜的 AI 代理。