研究者测了五个开源模型,发现 Mistral 7B 和 Muse Glimmer 能从已滑出窗口的缓存里找回信息,做长上下文推理的可以看看。
#Qwen
阿里云把 Apsara 大会开到阿姆斯特丹了,10 月 29 日,主讲 Qwen 模型和 Agent 基础设施,在欧洲的可以关注下。
阿里这次没发新模型,而是让 Qwen3.8-Max 自己训自己,33 轮迭代后成绩追上 Claude 和 GPT,还顺手把多模态价格砍了九成。
研究者拿 12 万多个中文事实问题测了 DeepSeek、Qwen 和 Doubao,发现让模型别顺着你说话,答案反而会变得含糊。做中文产品的话值得看看。
有人花 5 欧元租 GPU,让无审查版 Qwen 三十分钟改一个字节就破解了 IDM,这帖子把 AI 逆向能力聊得很具体。
阿里 Qwen3.8-Max 被曝跑了 33 轮自动训练迭代,AA 分数从 40 涨到 45,还有 2.4T 参数的说法。
Qwen 团队把智能体能力扩展到音视频了,Qwen3.8-Omni-Flash 能做视频剪辑和长视频翻译,还配了两个开源框架,做多模态应用可以看看。
Qwen 搞了三个手机智能体,能跨 App 帮你干活,官方说成功率 90%,比 Apple Intelligence 那种浅整合走得更深。
今天各家都在发东西:Meta 把 VR 做成眼镜,ChatGPT 语音能调插件了,Claude 开了应用市场,Qwen 的手机智能体真机成功率有 90%。
NVIDIA 把公开 Agent Skills 自动转成 RL 训练环境,产出近 8000 条任务,还开源了流水线思路,做 Agent 训练的可以看看。
新加坡的 AnyMind 把 Alibaba 的 Qwen 模型接进了自家直播电商平台 AnyLive,做直播带货的可以看看多模型架构怎么落地。
一篇把拍卖机制套到 LLM 采购上的论文,Llama 和 Qwen 实测显示固定定价比竞价贵 10% 到 71%,做 API 成本优化的可以看看思路。
阿里千问出的手机 Agent 三件套,规划、执行、创作分工明确,API 优先、点屏幕兜底,还把四套评测基准开源了,做手机智能体的可以看看。
Qwen 一次发了五款语音模型,能识别方言、区分多个说话人还能标注情绪,价格还砍了 95%,做语音应用的可以看看。
阿里 Qwen 出了三个手机智能体,能规划任务、操作手机、一句话生图,还把测试基准开源了,做移动端 Agent 的可以看看。
阿里这次一口气发了五款语音模型,方言识别和能自己生成配乐音效的 TTS-Next 都挺有意思,价格还砍了一波。
Qwen 的图像模型这次在 LMArena 两个榜单都是开源第一,图像编辑拿到 1367 分,总榜离 GPT-Image-1.5 只差 3 分,做图的朋友可以试试。
韶音把 Qwen 塞进了开放式耳机,双击就能问天气、记待办、总结会议,还能翻译,1398 元已经能买了。
拿 2267 份真实英国基金申请,让 Gemma 3 27B 和 DeepSeek R1 等六个开源模型打分,跟人类审稿人比相关系数,结论是初筛能用、终审不行。
SGLang、Qwen和NVIDIA联手推出NVFP4 KV Cache,4-bit精度下1.78倍容量提升,长上下文推理提速近80%。
谷歌推出的这个新基准测试挺有意思,专门测模型做真实 Android 开发的能力,比如从零写应用或者迁移代码,能看出不同模型在工程场景下的实际表现。
阿里巴巴用Qwen 3.8 27B模型做了个个人财务助手,能帮你把买房问题变成对话和财务目标,比以前快。