23:30IT之家(博客/媒体)Meta CEO扎克伯格呼吁美国减少对开源AI模型的限制,认为技术应普及而非集中在少数机构。Meta同日发布4bit量化模型Muse Glimmer,可在24GB或32GB显存的Mac/PC本地运行。报道称开放权重模型训练成本通常低于OpenAI、Anthropic的闭源模型。中国企业月之暗面Kimi K3、阿里Qwen3.8-Max和DeepSeek V4-Flash已能对标美国顶尖模型。行业MetaMuse Glimmer开源模型10 个信源在谈事件专题推荐理由:扎克伯格喊话放开开源AI,Meta还出了能本地跑的Muse Glimmer,顺带看看中国模型已经追到哪了。原文稍后读已读值得跟进有用关注 Meta
12:24Geek@geekbb75°VulcanBench 用 23 个真实软件工程任务评测模型,Qwen3.8-Max 跑完全套成本 126.25 美元,DeepSeek V4-Flash 仅需 13.60 美元。Qwen3.8-Max 每个任务耗时 20-25 分钟,是测试中最慢的模型,固定预算下最佳设置只排中游,默认设置垫底。六个原本能解决的任务贡献了 26 分降幅的 83%,其中三个得分直接归零。在准确率上 Grok 4.5 领先,按每美元准确率 DeepSeek V4-Flash 很难被击败。AI模型VulcanBenchQwen3.8-MaxDeepSeek V4-Flash7 个信源在谈事件专题推荐理由:VulcanBench 实测:Qwen3.8-Max 跑一趟 126 美元,DeepSeek V4-Flash 只要 13.6 美元,便宜 10 倍还更快。选性价比就 DeepSeek,选准确率就 Grok 4.5。原文稍后读已读值得跟进有用关注 VulcanBench
12:14官方一手arXiv: DeepSeek@Yi Liu该论文提出符号化—基底论题(Symbolization–Substructure Thesis)和涌现不变性公式 R_s^*=R_φ^*+C_s,认为规模扩展只能缩小补偿差 C_s,却无法消除任务接口下限 R_φ^*。作者用 DeepSeek V4-Flash 做了匹配实验:加入思考后指针追踪成绩从 0/16 提高到 14/16;观察孪生任务仍停在 50% 的构造下限;恢复关键记忆后成绩从 50% 升到 100%。这些结果支持“在同一接口内扩展规模”与“精化接口本身”之间的区别。论文DeepSeek V4-Flash涌现不变性推理模型10 个信源在谈事件专题推荐理由:V4-Flash实验:思考让指针追踪0/16→14/16,孪生任务仍50%。换接口比堆算力更重要。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
11:32shao__meng@shao__meng精选在 chatbot 阶段只需关注每个 token 的单价,而 agent 任务会进行多轮 loop、tool call 和代码执行,总 token 消耗与轮数影响更大。Cline 指出,仅比较 DeepSeek V4-Flash 与 Fable 的每 token 价格会误导,因为轮次增多可能导致单任务总成本更高。计算单个任务成本需综合 token 消耗总数、每 token 成本和缓存比例。ArtificialAnlys 的报告显示,DeepSeek 完成相同基准任务的总成本比 Fable 低 105 倍。技巧DeepSeek V4-FlashClineFable10 个信源在谈事件专题推荐理由:选 agent 模型别光看 token 单价,这帖讲了 task 成本公式,实测 DeepSeek 比 Fable 总成本低 105 倍。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
06:09elvis@omarsar0omarsar0在推文中称,DeepSeek V4-Flash等模型的token效率被低估,建议更激进地尝试不同测试框架。他提醒,DeepSeek V4-Flash的每token价格虽便宜,但多轮交互可能使单任务总成本更高。@ArtificialAnlys报告称,DeepSeek完成与Fable相同的基准任务时,总成本仅为Fable的1/105。AI模型DeepSeek V4-FlashFabletoken效率10 个信源在谈事件专题推荐理由:别光看每token单价:DeepSeek V4-Flash跑同基准总成本比Fable低105倍,这条推文有数据。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
17:46IT之家(博客/媒体)复旦大学'数据挖掘技术'课程期末改为'人考AI',学生每人出10道计算题,挑战三个AI模型:DeepSeek V4-Flash、MiniMax M2.7和Claude Sonnet 4.6。答错题数越多得分越高,DeepSeek答错一题+1.5分,MiniMax+2分,Claude+3分。51份试卷中,50人至少让一个AI答错一题,4人让某个模型得0分,但Claude未被完全考倒。全班平均分85.7,中位数88。行业复旦大学DeepSeek V4-FlashMiniMax M2.71 个信源在谈事件专题推荐理由:复旦让学生出题考AI,DeepSeek和MiniMax都被考倒,4人让AI得了0分。看看学生怎么找到盲区的。原文稍后读已读值得跟进有用关注 复旦大学
13:00@atomic_chat_hq@atomic_chat_hqStepFun 的 Step 3.7 Flash 模型与 DeepSeek V4-Flash 在物理动画生成任务中直接对比。任务要求编写自包含 HTML5 Canvas 动画,包含高尔顿板、旋转六边形中弹跳的球、五个同步节拍器三个场景。Step 3.7 Flash 输出 59.6k tokens (9分57秒),DeepSeek V4-Flash 输出 52.5k tokens (6分21秒)。虽然 DeepSeek 更快,但 StepFun 在物理模拟、视觉效果和逻辑渲染三个维度全面获胜。AI模型Step 3.7 FlashDeepSeek V4-FlashStepFun1 个信源在谈事件专题推荐理由:StepFun 的 Step 3.7 Flash 在生成物理动画上把 DeepSeek V4-Flash 比下去了,慢点但模拟和画面都好很多。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
10:49官方一手arXiv: DeepSeek@Xiaonan Xu, Wenjing Wu精选一篇来自 arXiv 的论文系统研究了技能文档的呈现粒度对大型语言模型智能体任务成功率的影响。实验基于 SkillsBench 基准,包含 30 个领域平衡的任务,测试了 GPT-5.5 和 DeepSeek V4-Flash 两种模型。结果显示,提供技能文档相比无技能条件,任务平均通过率提升 18 到 36 个百分点,效果显著。然而,技能文档的抽象程度(低抽象 vs 高抽象)以及是否包含示例对成功率的影响很小且统计上不显著。该研究表明,技能可用性是关键因素,而呈现细节的调整影响有限且依赖模型。论文LLM Agent技能文档任务成功率推荐理由:做 LLM Agent 开发的团队终于有了实证依据:给智能体塞技能文档比纠结怎么写更管用。建议直接参考这个实验设计来优化自己的 RAG 或工具调用策略。原文稍后读已读值得跟进有用关注 LLM Agent