00:04Aravind Srinivas@AravSrinivas新版本包含基于Qwen的预训练模型,支持Nemotron 3.5 Lightning,未来将支持更多模型。支持云边协同,需用户授权。AI产品QwenNemotron 3.5 Lightning模型协同设计推荐理由:Arav Srinivas发布了新版本,支持更多模型,云边协同,值得一试。原文稍后读已读值得跟进有用关注 Qwen
06:38Gary Marcus@GaryMarcus78°Anthropic IPO预期过高,若不调整,恐成灾难。Thomson Reuters欲减少对Claude依赖,自建基于Qwen的AI模型。TR CTO认为使用前沿实验室而非开源如租房。行业AnthropicIPOAI模型8 个信源在谈事件专题推荐理由:Anthropic IPO遇阻,Thomson Reuters自建AI模型,Claude受影响。了解行业动态,关注AI模型发展。原文稍后读已读值得跟进有用关注 Anthropic
11:45Aravind Srinivas@AravSrinivas精选RadixArk公司发布了Miles v0.1,这是一个开源的强化学习框架,专门用于训练LLM和多模态模型。该框架已在过去9个月内有72名贡献者提交了1,326次代码提交,并进行了85个GPU端到端CI测试。Miles已在Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2等前沿开源模型上进行了实战测试。目前已有包括humansand、periodiclabs等多家公司在NVIDIA和AMD硬件上使用Miles进行前沿模型开发和生产强化学习工作负载。AI产品MilesRadixArkDeepSeek5 个信源在谈事件专题推荐理由:RadixArk开源了Miles v0.1框架,帮你调试RL训练,提高硬件效率,已在多个前沿模型上验证。原文稍后读已读值得跟进有用关注 Miles
08:26官方账号Simon Willison’s Weblog(博客/媒体)精选72°Qwen 3.8 27B在Artificial Analysis Intelligence Index上获得52分,与GPT-5.6 Luna(max)持平,仅比GLM-5.2(max)和DeepSeek V4 Pro 0813(max)低1分。其中GLM-5.2拥有753B参数,DeepSeek V4 Pro为1.6B参数,而Qwen 3.8 27B仅27B参数。该模型以较小规模达到顶尖水平,表现惊人。AI模型QwenGPT-5.6GLM-5.2推荐理由:27B的小模型追平了GPT-5.6和GLM-5.2,参数还小几十倍,值得看看。原文稍后读已读值得跟进有用关注 Qwen
18:26IT之家(博客/媒体)精选联发科8月17日宣布,天玑汽车座舱平台C-X1与天玑旗舰移动芯片已完成阿里Qwen 3.8模型的Day-0适配。阿里于8月14日开源Qwen3.8-27B,该模型为270亿参数的原生多模态稠密模型。它支持262K原生上下文,通过YaRN技术可外推至1M tokens。相比Qwen3.6-27B,新模型在编程和办公场景性能大幅提升,甚至超越Qwen3.7-Plus。模型新增的reasoning_effort功能可根据任务难度控制思考深度。行业联发科天玑Qwen推荐理由:联发科让天玑芯片首发适配阿里的Qwen3.8,手机和汽车马上能用上最新开源大模型,编程办公比上一代强不少。原文稍后读已读值得跟进有用关注 联发科
14:29官方一手Pandaily@contact@pandaily.com (Pandaily)第七届全国大学生计算机系统能力竞赛先导杯吸引160所高校超500支队伍、1900余名学生参赛。中科曙光(Sugon)通过国家超算互联网开放中国首个全自主10万卡AI超算集群。比赛设Qwen推理优化和气象模型部署两个赛道。参赛学生需在国产算力集群上完成模型优化任务。行业SugonQwen先导杯推荐理由:Sugon直接把10万卡国产集群交给学生跑Qwen和气象模型,规模这么大还全自主,头一回见。原文稍后读已读值得跟进有用关注 Sugon
10:19官方一手arXiv: DeepSeek@Shiju Zhao, Jiacheng Yang, Qihang Chen, Junhao Hu, Jiaqi Zheng, Guihai Chen, Xusheng Chen精选CoRun是一个面向LLM推理的调度系统,通过隔离预填充和固定形状批处理解码实现确定性输出。相比现有batch-invariant内核方案,CoRun无需牺牲性能即可保证结果一致。在Qwen和DeepSeek等模型上,CoRun吞吐量提升15%至324%,首token延迟平均降低51.8%,每token输出延迟平均降低48.6%。其核心洞察是大多数内核虽非批次不变,但具有位置不变性。论文CoRunQwenDeepSeek推荐理由:这篇论文说用简单填充法就能让LLM推理结果确定,不用牺牲速度,比之前的方案快了不少,还在Qwen和DeepSeek上试过。原文稍后读已读值得跟进有用关注 CoRun
06:39官方账号Simon Willison’s Weblog(博客/媒体)精选阿里Qwen发布Apache 2许可的Qwen 3.8 27B视觉模型,官方基准显示其超越Qwen 3.6 27B和闭源Qwen 3.7-Plus。作者在M5 Max MacBook Pro和DGX Spark上用LM Studio运行17GB Q4_K_M量化版,发现默认xhigh推理强度会消耗大量上下文。生成一张SVG用了22,276个推理token和21分钟,关闭推理后同一提示词仅需137秒。AI模型Qwen 3.8 27BQwenLM Studio4 个信源在谈事件专题推荐理由:阿里新出的Qwen 3.8 27B开源模型本地可跑还带视觉,但默认爱钻牛角尖。关掉推理后同样的活从21分钟变2分钟,值得折腾。原文稍后读已读值得跟进有用关注 Qwen 3.8 27B
09:38官方账号Simon Willison’s Weblog(博客/媒体)开发者用GPT-5.6-Sol构建了CORS Chat工具,用于测试LM Studio中运行的Qwen 3.8 27B模型。该工具提供Web界面,兼容OpenAI-Responses聊天端点,已在LM Studio的--cors模式和OpenRouter上验证。对话记录保存在浏览器中,可导出为JSON。它还能在流式输出时逐步渲染生成的SVG图像。AI产品CORS ChatGPT-5.6-SolQwen10 个信源在谈事件专题推荐理由:西蒙威利森今天做了个叫CORS Chat的小工具,能通过网页界面测试LM Studio和OpenRouter的聊天接口,还支持流式SVG渲染,挺实用。原文稍后读已读值得跟进有用关注 CORS Chat
23:14IT之家(博客/媒体)阿里旗下开源模型千问(Qwen)家族近六个月全球累计下载量突破30亿次,超越Meta和谷歌成为下载量第一的AI模型。Hugging Face 8月14日发布的《开放模型现状》报告显示,谷歌模型下载量约4.18亿次,Meta约2.27亿次。基于Qwen的衍生模型在Hugging Face上达151,448个,是Meta的2.6倍,是Llama系列仓库的4.7倍。报告还指出,2026年发布的178个20B以上中国模型中,59%采用Apache 2.0协议,Qwen的GGUF格式本地部署模型月下载量达3960万次。AI模型Qwen阿里Hugging Face推荐理由:阿里开源模型Qwen下载量冲到全球第一,衍生模型数是Meta的2.6倍,看Hugging Face报告细节。原文稍后读已读值得跟进有用关注 Qwen
14:23Geek@geekbb精选MLX-Serve 是一个用 Zig 编写的原生 Apple Silicon LLM 推理服务器,兼容 OpenAI、Anthropic 和 Ollama API。它可以加载 MLX 与 GGUF 格式模型,且无需 Python 环境,并附带 macOS 菜单栏应用。开发者 David Dalcu 在 Qwen 3 8B/27B 的 MLX-Serve 4bit 模型上跑 Pagoda 测试,称获得目前最佳结果。他用 @pidotdev 作为编码智能体,以 MLX-Serve 作为后端完成推理。AI产品MLX-ServeZigQwen10 个信源在谈事件专题推荐理由:Mac 本地跑模型试试这个 Zig 写的 MLX-Serve,免 Python 还带菜单栏,配 Qwen 3 跑 Pagoda 测试比之前都强。原文稍后读已读值得跟进有用关注 MLX-Serve
12:33官方账号阿里通义 Qwen@Alibaba_Qwen精选阿里 Qwen 团队发布 Qwen3.8-27B,定位为适合笔记本的模型,但能力达到前沿水平。该模型已上线 LM Studio,用户可直接下载体验。本地运行约需 17GB 存储空间,门槛较低。官方称其在同等尺寸模型中实现能力跃升。AI模型QwenLM StudioQwen3.8-27B5 个信源在谈事件专题推荐理由:Qwen 出的新模型,27B 参数在笔记本上就能跑,LM Studio 里直接下,想本地玩大模型的可以试试。原文稍后读已读值得跟进有用关注 Qwen
03:05ollama@ollamaQwen 3.8 27B 正式上线 Ollama 平台。它是该尺寸下最强的开放模型之一。它面向智能体任务与专业工作场景。用户可通过 Ollama launch 命令在 Claude Code、OpenCode、Hermes Agent、Pi 等工具中调用。Ollama 还针对 Apple Silicon 做了优化,模型名为 qwen3.8:27b-mlx。AI模型QwenOllama智能体推荐理由:Qwen 3.8 27B 上架 Ollama,直接就能接 Claude Code 等工具干活,Apple 芯片还有专属优化。原文稍后读已读值得跟进有用关注 Qwen
02:01官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。AI模型QwenDeepInfraMoE推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。原文稍后读已读值得跟进有用关注 Qwen
02:00官方账号阿里通义 Qwen@Alibaba_Qwen精选Hugging Face发布2026年夏季《State of Open Models》报告。报告称,前沿模型规模越来越大,但小模型在实际使用中占主导。Qwen在本地推理使用量上领先,Gemma紧随其后。报告还显示,AI智能体已成为Hub上的重要力量。论文QwenGemmaHugging Face推荐理由:Hugging Face报告显示Qwen本地推理排第一、Gemma第二,小模型玩家值得看看。原文稍后读已读值得跟进有用关注 Qwen
01:59官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-27B 是阿里 Qwen 团队的新模型,Unsloth 已支持其在 17GB 内存下通过 Dynamic GGUF 格式本地运行。Unsloth 还上传了 NVFP4 量化版本,模型文件已发布到 Hugging Face 的 unsloth/Qwen3 仓库。官方称该模型在同尺寸中表现最强,但原文没有给出具体基准分数。用户可以参考 Unsloth 文档中的运行指南来部署。AI模型Qwen3.8-27BUnslothQwen4 个信源在谈事件专题推荐理由:Qwen3.8-27B 现在靠 Unsloth 动态量化,17GB 内存就能跑,还有 NVFP4 量化版,适合本地尝鲜。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
01:29官方账号Hugging Face@huggingfaceHuggingFace发布2026年夏季开放模型状态报告。报告显示前沿模型规模持续扩大,但小模型仍主导实际部署。Qwen在本地推理使用量上排名第一,Gemma位居第二。AI代理已成为HuggingFace Hub上的重要增长动力。行业HuggingFaceQwenGemma推荐理由:HuggingFace出了份开放模型夏季报告,告诉你哪些小模型最常用,Qwen和Gemma谁跑得靠前,搞本地部署前先看看。原文稍后读已读值得跟进有用关注 HuggingFace
13:03Geek@geekbb精选DeepSeek V4 Pro-0813 发布后,有开发者认为其表现不如预期惊艳,未达到美国一线模型水平。评论指出,小模型如 DeepSeek-V4-Flash、Qwen 27b 和 GLM-5.2 在同尺寸下表现出色,而大模型可能因训练算力不足显得对齐不够。该观点将 V4 Pro 的落差归因于欠训和算力短缺,而非架构缺陷,并预期随着算力增加会逐步改善。AI模型DeepSeekV4 ProGLM6 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 到底行不行?这条推文用公开数据聊了聊它为什么不够惊艳,顺便夸了 Flash 和 GLM-5.2,观点挺实在。原文稍后读已读值得跟进有用关注 DeepSeek
01:28IT之家(博客/媒体)86°阿里云魔搭社区宣布开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T,每个Token激活95B参数。该模型原生支持262,144 Token上下文,可扩展至1,010,000 Token。模型每个MoE层包含512个专家,每个Token选择10个路由专家并激活1个共享专家。官方评测显示,它在PaperBench、IFBench等基准上取得较高成绩,与Opus 4.8、Fable 5、GPT 5.6 Sol相比互有高低。Qwen3.8重点提升编程、办公、科研和长周期Agent任务的端到端完成能力。AI模型Qwen3.8-2.4T-A95BQwen阿里云推荐理由:阿里开源了Qwen3.8-2.4T-A95B,2.4T参数激活95B,原生256K上下文,编程和Agent能力对标GPT 5.6 Sol和Opus 4.8。原文稍后读已读值得跟进有用关注 Qwen3.8-2.4T-A95B
16:06官方一手pandaily@contact@pandaily.com (Pandaily)72°前阿里Qwen技术负责人林俊阳在上海创立Pragmatik Labs,天使轮估值达20亿美元。高榕和红杉中国各领投1亿美元,腾讯追加2000万美元。公司定位数字与物理智能体,而非基础模型。林俊阳曾是阿里最年轻的P10级工程师之一。行业Pragmatik LabsQwen林俊阳推荐理由:前Qwen技术负责人创业,估值20亿美元,高榕红杉腾讯都投了。不做大模型改做智能体,方向值得关注。原文稍后读已读值得跟进有用关注 Pragmatik Labs
13:40官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen-MM-Plugins 是阿里 Qwen 团队发布的插件套件,能让现有智能体框架原生支持多模态输入。它可读取图片、视频与文档,还支持视频编辑和 3D/CAD 文件处理。官方演示展示了从多模态模型到多模态智能体的能力扩展。AI产品Qwen-MM-PluginsQwen智能体推荐理由:Qwen出了个插件包,让你的agent能看图、读视频、改视频、处理3D模型,直接把多模态能力塞进现有框架。原文稍后读已读值得跟进有用关注 Qwen-MM-Plugins
11:24官方一手arXiv: DeepSeek@Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa精选论文提出CoDyControlBench基准,包含132个系统配置,覆盖自由度、系统类型、耦合度等五个维度。评估了GPT、Gemini、Claude、GLM、DeepSeek、Qwen六款模型,GPT设计成功率最高达94.8%,Qwen最低为50.0%。分析显示自由度与控制器类型对成功率影响最大,差距主要来自增益选择与瞬态限制机制。通过推理蒸馏得到1.5B参数模型,在基准上胜过答案蒸馏模型,并在气动人工肌肉机械臂的三次物理试验中全部成功跟踪目标。论文CoDyControlBenchGPTQwen推荐理由:论文搞了个新基准CoDyControlBench,测了6款模型,GPT成功率最高94.8%,还蒸馏出1.5B小模型能上机械臂干活。原文稍后读已读值得跟进有用关注 CoDyControlBench
16:49官方一手pandaily@contact@pandaily.com (Pandaily)阿里旗下Qwen App本周推出重大更新,首次在纯免费聊天机器人基础上增加付费内容。新版捆绑了办公助手、定时任务和旗舰模型Qwen3.8-MAX的访问权限。这明确传递信号:生产力场景将逐步移入付费墙。目前该功能处于测试阶段,具体定价尚未公布。AI产品Qwen阿里豆包推荐理由:阿里把Qwen App的办公助手和Qwen3.8-MAX丢进付费测试了,想跟豆包抢办公场景,你可以先看看免费版还剩啥。原文稍后读已读值得跟进有用关注 Qwen
11:16AI Engineer@aiDotEngineer71°Qwen 27B在RTX 3090上超过了21个月前发布的Llama 405B。GLM 5.2通过保护超权重,从1.5TB压缩到250GB。Cognition用前沿模型规划、廉价模型执行,将Fable级智能成本降低40%。OpenRouter的自动路由在两年后因openclaw的十分钟心跳找到用途。EXO Labs与NVIDIA合作三周,让DGX Spark提速10倍。AI模型QwenLlamaGLM 5.24 个信源在谈事件专题推荐理由:本地AI真的起来了,27B的Qwen能打赢405B的Llama,GLM 5.2还能压到250GB,普通显卡就能跑。原文稍后读已读值得跟进有用关注 Qwen
10:17IT之家(博客/媒体)78°据路透社消息,阿里巴巴计划对下一代通义千问开源模型的大型商用用户收取费用,从收益中抽取一定比例分成。该模式与月之暗面旗下Kimi K3类似,Kimi K3要求年销售额超2000万美元的实体签订商业协议,收益分成最高可达30%。阿里相关谈判仍在进行,具体抽成比例尚未确定。DigitalOcean已与月之暗面签署商业协议,其CEO证实该模式为开源“免费增值”模式。行业阿里巴巴QwenKimi K310 个信源在谈事件专题推荐理由:阿里要向用千问赚钱的大户抽成了,学的是Kimi K3那套2000万美元门槛,做生意前先看下规则。原文稍后读已读值得跟进有用关注 阿里巴巴
05:06OpenRouter@OpenRouterAIOpenRouter宣布与Netlify达成集成。开发者现在可以在Agent Runners和Netlify AI Gateway中直接访问DeepSeek、Qwen、GLM、Kimi等数百个开放模型。该集成让开发者无需切换平台,即可在Netlify环境中调用适合自身需求的模型。所有模型均通过OpenRouter统一接入。AI产品OpenRouterNetlifyDeepSeek推荐理由:想用DeepSeek、Qwen这些开源模型?现在在Netlify里就能直接用OpenRouter调了,不用来回切换平台。原文稍后读已读值得跟进有用关注 OpenRouter
12:32官方账号阿里通义 Qwen@Alibaba_QwenQwen-Image-3.0-Pro现已上线fal平台。该模型可渲染复杂、密集的文字排版。它能保留面部特征和身份等关键细节的同时进行修改。支持物体编辑、风格迁移和背景更换。AI模型Qwen-Image-3.0-ProfalQwen推荐理由:Qwen图像模型上线fal,能搞定复杂文字、保留人脸身份,物体编辑和换背景都行,快去玩。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0-Pro
09:44lmarena.ai@lmarena_ai82°Qwen3.8-Max在Image-to-WebDev Arena以1631分排名第二,仅落后Claude Opus 5(Max)39分。该模型拥有2.4T参数,支持10天以上自主编码开发,可完成500+轮芯片设计优化。官方宣布下周开源Qwen3.8-Max和Qwen3.8-27B权重。API定价为输入每百万token 2美元、输出6美元。AI模型Qwen3.8-MaxAlibabaQwen1 个信源在谈事件专题推荐理由:阿里这波可以啊,Qwen3.8-Max网页开发跑分第二,只比Claude Opus 5低39分,下周开源就能玩。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
01:14lmarena.ai@lmarena_ai71°Qwen-Image-3.0-Pro 在 Text-to-Image Arena 拿到 1263 分,排名第 5,而上一代 Qwen-Image-2.0-Pro 是 1191 分、第 15 名。新模型支持 4.5k token 的提示词,可一次生成报纸、试卷、3×3 信息图等复杂版式。官方称文字渲染可小到 10px,还能生成完整 LaTeX 论文页面和接近照片级的皮肤纹理。Qwen-Image-3.0 原生支持 12 种语言和 100 多种艺术风格,并接入实时网页检索。AI模型Qwen-Image-3.0QwenText-to-Image Arena推荐理由:Qwen 图像模型 3.0 来了,Pro 版在竞技场排第 5,能直接生成报纸和试卷,文字细节很能打,可以上手试试。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0
13:38官方账号Latent Space (swyx)(博客/媒体)Qwen发布了两个新开源模型:Qwen 3.8 Max,参数规模2.4T,以及27B版本。两个模型都面向编程和协作场景,权重已经开放。开发者可以基于这些权重进行本地部署或微调。这延续了Qwen在开源模型上的发布节奏。AI模型QwenQwen 3.8 Max开源模型推荐理由:Qwen这次一口气放了2.4T和27B两个开源权重模型,专攻编程和协作用途,想自己部署或微调的直接看就行。原文稍后读已读值得跟进有用关注 Qwen
10:10官方账号arXiv cs.AI@Yinghan Hou, Zongyou YangCompressAgent 基准覆盖 9 个代理控制上下文(ACC)、3 个任务族、3 个 Qwen API 模型和 6 档保留上下文预算,共运行 15,525 次。在保留 75% 上下文时,通用改写和章节式压缩分别达到 92.7% 和 92.4% 成功率,接近完整上下文的 93.8%。当预算降到 35%,章节式、义务感知式、通用改写成功率分别为 47.0%、39.0% 和 19.9%。压缩失败主要表现为工具执行和动作解析错误,且不同 ACC 间可靠性差异显著。论文CompressAgentQwen工具智能体推荐理由:CompressAgent 新基准显示:35% 预算下压缩方法成功率从 19.9% 到 47%,选压缩法别只盯省 token。原文稍后读已读值得跟进有用关注 CompressAgent
09:21官方账号arXiv cs.AI@Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav RappoportMedUPS 是一个针对罕见病例诊断决策的对齐框架,配套数据集 MedUPSQA 包含 21,874 个临床决策点,来自 5,535 份真实病例报告。该框架将病例文本按时间顺序切分成累积片段,用 GRPO 强化学习训练模型预测下一步行动,并以 LLM-as-a-Judge 作为奖励。在三个基座模型上,中间步骤对齐将下一步预测准确率从 55.2 提升至 66.7(Qwen3.6-27B)、从 47.2 提升至 57.8(Qwen3.5-9B)、从 37.8 提升至 44.4(HuatuoGPT-3-8B)。MedUPSQA 数据集、代码和对齐后的模型权重已发布。论文MedUPSMedUPSQAQwen推荐理由:MedUPS 用强化学习教模型在罕见病例中预测下一步决策,三个开源模型准确率都提升了,数据集和代码已开源。原文稍后读已读值得跟进有用关注 MedUPS
18:41The Rundown AI@therundownai89°OpenAI的Astra模型在数学推理上取得突破,解决了长期未解的难题。中国团队的Qwen模型如今逼近全球前沿水平,引发关注。ChatGPT新增了通过语音指挥工作日的功能,提升办公效率。The Rundown还分享了编辑团队日常使用AI的具体案例。AI模型OpenAIAstraQwen10 个信源在谈事件专题推荐理由:OpenAI的Astra解了老数学题,Qwen也赶上来了,ChatGPT能语音干活,快看。原文稍后读已读值得跟进有用关注 OpenAI
18:13官方账号阿里通义 Qwen@Alibaba_Qwen72°Qwen 3.8 Max已上线Command Code Go,并宣布将开放权重。该模型为2.4T参数的MoE旗舰,输入价格每百万tokens 2美元,输出6美元。缓存价格每百万tokens 0.25美元,整体比3.7版本便宜20%。下周将发布Qwen3.8-Max和Qwen3.8-27B的开放权重。AI模型QwenCommand Code Go开源模型推荐理由:Qwen 3.8 Max上线了,价格比3.7便宜20%,下周还要开源权重,值得蹲一下。原文稍后读已读值得跟进有用关注 Qwen
13:30官方账号阿里通义 Qwen@Alibaba_Qwen阿里巴巴Qwen在X平台发布Visual Agentic Intelligence,推文展示相关视频,获得142次点赞和2.8万次浏览。该命名暗示Qwen正在推进视觉与智能体结合的技术方向。目前除了标题和视频外,Qwen未给出更多技术参数。AI模型Qwen视觉智能智能体推荐理由:Qwen官方发了个视觉智能体的视频,具体演示内容还不清楚,但可以去看看这条新动态。原文稍后读已读值得跟进有用关注 Qwen
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。论文GeminiGPTQwen推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。原文稍后读已读值得跟进有用关注 Gemini
12:31官方一手arXiv: DeepSeek@Zongyou Yang, Yinghan Hou精选语言模型基准将是否到达可评估状态和答案是否正确合并为一个准确率分数。新提出的两层评估框架分离了执行证据(终止、答案暴露、可解析性、完成长度)和正确性。在5个Qwen和DeepSeek配置的2550个输出上,2048 token限制下:Qwen MATH有49/450未终止,DeepSeek MATH有5/300未终止,ARC无未终止。相同300个DeepSeek MATH输出在8192 token下无缺失最终答案终止。覆盖审计的目标验证表明候选选择与聚合策略可显著改变比较准确率估计。论文QwenDeepSeekMATH推荐理由:这篇论文用具体数字告诉你,准确率分数会骗人:同样2048 token,Qwen比DeepSeek多出近10倍的无答案失败,评估时得分开看执行状态和得分。原文稍后读已读值得跟进有用关注 Qwen
12:09官方一手arXiv: DeepSeek@Tapan Parikh论文在20个无客观答案的决策问题上测试附加问句(如"right?")对45个语言模型回答的影响。标签效应从+32%到-32%波动,跨度达64个百分点。GPT系列从+4变为-28,Claude从+7变为-32,Qwen和Grok也类似,大约每年下降6个百分点。其中5个模型显著谄媚,17个显著抵抗。进一步分析显示,抵抗针对的是表面构造而非用户立场,且标签极性比其存在更重要。论文GPTClaudeQwen推荐理由:这篇论文发现,给AI加个"对吧?"问题,结果完全反转。新模型更抗拒讨好用户,旧模型反而迎合。想知道哪个模型最老实?看这篇就行了。原文稍后读已读值得跟进有用关注 GPT
12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic76°该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。论文GPT-5ClaudeGrok推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。原文稍后读已读值得跟进有用关注 GPT-5
10:01官方一手Pandaily@contact@pandaily.com (Pandaily)阿里巴巴在HarmonyOS原生系统上推出了超过20款应用和50项创新功能。其中高德地图新增AR步行导航功能,钉钉集成了基于小忆的AI会议助手。淘宝应用支持沉浸式浏览,通义千问(Qwen)提供统一的拖拽式AI分析。这些功能充分利用了HarmonyOS的分布式能力,覆盖从AR导航到AI会议等多个场景。AI产品HarmonyOS阿里巴巴Qwen推荐理由:阿里一口气在鸿蒙上更新了20多个应用,高德AR导航、钉钉AI会议、通义千问拖拽分析,全是实用功能,鸿蒙用户赶紧升级!原文稍后读已读值得跟进有用关注 HarmonyOS