产品多源确认精选73°14:05Gemini-3.8-Flash上线Genspark平台Google发布Gemini 3.8 Flash,比前代仅三周就更新,推理和编码能力更强。#Gemini-3.8-Flash#Genspark#Google#推理模型10 个信源在谈事件专题Genspark@genspark_ai11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini-3.8-Flash
论文精选73°12:06Cliff:从首次错误中学习过程奖励研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。#Cliff#RLVR#强化学习#推理模型aarXiv cs.LG@Peixuan Han 等 6 人原文稍后读已读值得跟进有用关注 Cliff
论文精选73°11:50Trace as State:长上下文Transformer的条件状态更新DeepSeek和GLM-5.2通过将推理痕迹前置,长上下文推理准确率大幅提升,最高达100%。#Trace as State#DeepSeek V4 Pro Preview#GLM-5.2#长上下文aarXiv: DeepSeek@Xu Zou, Jie Tang原文稍后读已读值得跟进有用关注 Trace as State
论文73°11:42医疗问答中的误导上下文机制研究医疗AI研究团队发现模型对断言比对证据更易受影响,开放推理轨迹能更好检测错误决策。#MedMisBench#医疗问答#推理模型#LLM监控aarXiv cs.LG@Robin Linzmayer, Noémie Elhadad原文稍后读已读值得跟进有用关注 MedMisBench
模型Agent 与开发者78°10:14Muse Spark 1.3 发布Meta 推出了 Muse Spark 1.3,智能体和编码能力大幅提升,成本降低 25%,更适合生产环境使用。#Muse Spark#Meta AI#智能体#编码助手shao__meng@shao__meng原文稍后读已读值得跟进有用关注 Muse Spark
模型中美对照多源确认78°08:48Gemini 3.8 Flash 发布:接近前沿模型能力Google 发布了 Gemini 3.8 Flash,价格更低但性能接近前沿模型,成本效率大幅提升。#Gemini#Gemini 3.8 Flash#Opus 5#推理模型10 个信源在谈事件专题shao__meng@shao__meng11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型73°07:22西班牙推出Quasar 438B模型,欧洲最强AI西班牙公司推出欧洲最强AI模型Quasar 438B,1M词元上下文,比Mistral Medium 3.5得分高13。#Quasar 438B#Multiverse Computing#推理模型#长上下文IIT之家原文稍后读已读值得跟进有用关注 Quasar 438B
模型中美对照04:43Qwen3.6-35B-A3B 在 MacBook Pro 上性能测试Qwen3.6-35B-A3B 在苹果笔记本上跑得比 MLX-LM 还快,吞吐量提升超 20%,质量不打折。#Qwen3.6-35B-A3B#MLX-LM#MacBook Pro#性能基准官方账号Perplexity@perplexity_ai原文稍后读已读值得跟进有用关注 Qwen3.6-35B-A3B
产品04:43Lily适配苹果硅架构Perplexity开源了Lily项目,专门优化Qwen模型在苹果硅芯片上的推理性能。#Lily#Qwen#苹果硅#推理模型官方账号Perplexity@perplexity_ai原文稍后读已读值得跟进有用关注 Lily
产品中美对照04:23Muse Spark 1.3 版本发布Meta 推出了 Muse Spark 1.3,即将加入最大推理功能,安全测试后上线。#Muse Spark#Meta#Meta Model API#推理模型官方账号Meta AI@AIatMeta原文稍后读已读值得跟进有用关注 Muse Spark
模型中美对照多源确认73°04:22OpenAI新推理技术引发安全专家担忧OpenAI的Astra模型用'循环深度'技术突破顺序思维,安全专家对此表示担忧。#OpenAI#Astra#推理模型#AI安全10 个信源在谈事件专题techcrunch@Russell Brandom11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
模型Agent 与开发者多源确认03:38Gemini 3.8 Flash 登陆 Poe 平台Google 的 Gemini 3.8 Flash 登陆 Poe,速度快成本低,适合编程和智能体任务,还有百万上下文窗口。#Gemini#Gemini 3.8 Flash#Poe#推理模型10 个信源在谈事件专题Poe@poe_platform11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
产品多源确认73°01:35Gemini 3.8 Flash与AI SDK结合使用Google刚推出Gemini 3.8 Flash,比三周前的3.7 Flash更强,现在可以用AI SDK直接调用。#Gemini#Gemini 3.8 Flash#AI SDK#推理模型10 个信源在谈事件专题AI SDK@aisdk11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照01:13Google发布Gemini 3.8 Flash第三款经济模型Google六周连推三款经济模型,Gemini 3.8 Flash虽成本低但推理消耗高。#Gemini#Claude Opus 5#Google#推理模型官方账号Decoder@Matthias Bastian原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认73°00:40Gemini 3.8 Flash模型发布Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。#Gemini#Gemini 3.8 Flash#Google#推理模型10 个信源在谈事件专题Paul Couvert@itsPaulAi11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照78°00:17GoogleDeepMind发布Gemini 3.8 Flash模型GoogleDeepMind刚发布的Gemini 3.8 Flash价格不变但性能全面超越前代,覆盖多个专业领域基准。#Gemini#GoogleDeepMind#OpenRouter#推理模型OpenRouter@OpenRouterAI原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认73°00:15Gemini 3.8 Flash正式发布Google发布Gemini 3.8 Flash,比前代表现更好,特别适合复杂编程和智能体任务。#Gemini#Gemini 3.8 Flash#Google#智能体10 个信源在谈事件专题Philipp Schmid@_philschmid11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认73°00:14Gemini 3.8 Flash模型面向Pro和Ultra用户开放Google发布了Gemini 3.8 Flash,Pro和Ultra用户现在可以用它做文本分析和复杂编程了。#Gemini#Gemini 3.8 Flash#Google#多模态10 个信源在谈事件专题Google Gemini App@GeminiApp11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照00:13MiniMax H3 Max 现已上线MiniMax 发布了 H3 Max 模型,在 OpenRouter 上就能用,性能比前代有明显提升。#MiniMax#H3 Max#OpenRouter#推理模型1 个信源在谈事件专题OpenRouter@OpenRouterAI2 个信源在谈原文稍后读已读值得跟进有用关注 MiniMax
模型中美对照00:13MiniMax H3 Max 上线 OpenRouterMiniMax 推出了比 H3 更快更便宜的 H3 Max,在 OpenRouter 上就能用。#MiniMax#H3 Max#OpenRouter#推理模型1 个信源在谈事件专题OpenRouter@OpenRouterAI2 个信源在谈原文稍后读已读值得跟进有用关注 MiniMax
模型中美对照多源确认73°00:08谷歌发布Gemini 3.8 Flash模型谷歌新发布的Gemini 3.8 Flash能自主完成复杂项目,比前代模型推理能力更强,还支持视频理解与编程的智能体循环。#Gemini#Gemini 3.8 Flash#智能体#推理模型10 个信源在谈事件专题官方账号Google AI@GoogleAI11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认00:08Gemini 3.8 Flash 专注复杂推理Google 推出了 Gemini 3.8 Flash,能自动生成硬件设备的 3D 拆解视图,比普通模型更擅长复杂推理任务。#Gemini 3.8 Flash#ThreeJS#GoogleAIStudio#推理模型10 个信源在谈事件专题Google AI Developers@googleaidevs11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
模型中美对照多源确认73°22:53OpenAI称Astra为最危险模型OpenAI的Astra模型被标记为最危险系统,新架构让监控变得更困难,安全与能力平衡面临挑战。#Astra#OpenAI#推理模型#AI安全10 个信源在谈事件专题官方账号Decoder@Maximilian Schreiner11 个信源在谈原文稍后读已读值得跟进有用关注 Astra
模型中美对照多源确认15:58Claude Fable/Mythos 5.1 发布Anthropic 推出 Claude Fable/Mythos 5.1,价格大幅降低但输出能力提升,性价比超高。#Claude#Fable#Mythos#Anthropic10 个信源在谈事件专题官方账号Latent Space (swyx)11 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型多源确认15:03Fable 5.1 降价至原价四分之一Fable 5.1 大幅降价,缓存价格仅原价四分之一,Agent 使用成本降25-45%,Opus5性价比受挑战。#Fable 5.1#Opus5#Agent#推理模型2 个信源在谈事件专题orange.ai@oran_ge3 个信源在谈原文稍后读已读值得跟进有用关注 Fable 5.1
模型中美对照73°11:53Qwen3.8-Max-0902登顶CodeArena WebDev排行榜阿里Qwen3.8-Max-0902以1691分登顶CodeArena WebDev排行榜,比前代模型高出22分,价格仅5美元/百万token。#Qwen3.8-Max-0902#CodeArena#WebDev#Alibaba_Qwen官方账号阿里通义 Qwen@Alibaba_Qwen原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
模型中美对照73°11:08Qwen3.8-Max-0902登顶Code Arena: WebDev阿里Qwen3.8-Max-0902在代码基准测试中超越Claude和Kimi,价格实惠,多项类别领先。#Qwen3.8-Max-0902#Alibaba_Qwen#Code Arena#WebDevlmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
模型中美对照73°10:18Qwen3.8-Max-0902发布阿里升级了Qwen3.8-Max到0902版本,参数量和上下文都大幅提升,企业级任务表现更强,价格也公布了。#Qwen3.8-Max-0902#Qwen#阿里巴巴#多模态官方账号阿里通义 Qwen@Alibaba_Qwen原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
论文精选73°10:08扩散模型作为无时间步迭代推理训练课程新研究将扩散模型转化为迭代推理器,解决数独和迷宫问题表现优异,无需并行回滚或外部验证器。#扩散模型#迭代推理#Sudoku-Extreme#Maze-UniqueaarXiv cs.LG@Mariia Drozdova 等 7 人原文稍后读已读值得跟进有用关注 扩散模型
论文精选73°09:40潜在递归思想:冻结大模型的推理方法研究人员提出LRT方法,让冻结大模型在连续表示空间中进行推理,仅需少量计算就能超越传统方法。#LRT#冻结LLM#推理模型#连续空间aarXiv cs.AI@Zhaoliang Chen, Jie Fu原文稍后读已读值得跟进有用关注 LRT
模型中美对照多源确认精选73°08:23Claude Fable 5.1 发布Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。#Claude#Fable#推理模型#多模态7 个信源在谈事件专题S官方账号Simon Willison’s Weblog8 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型中美对照多源确认06:48Claude模型在多项基准测试中创纪录Claude在两项重要基准测试中大幅领先Fable 5,科学任务得分翻倍,综合能力提升13.8%。#Claude#Fable 5#Terminal-Bench-Science#Terminal-Bench6 个信源在谈事件专题Claude@claudeai7 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型中美对照多源确认73°04:38OpenAI即将发布Astra模型OpenAI要发Astra了,网络安全能力达到Critical级别,安全措施和能力同步升级。#Astra#OpenAI#网络安全#推理模型10 个信源在谈事件专题官方账号OpenAI@OpenAI (@OpenAI)11 个信源在谈原文稍后读已读值得跟进有用关注 Astra
模型多源确认73°04:13Fable 5.1 展示复杂任务处理能力Anthropic 发布 Fable 5.1,擅长处理复杂长期任务,为科学进步提供新视角。#Fable#Anthropic#推理模型10 个信源在谈事件专题Claude@claudeai11 个信源在谈原文稍后读已读值得跟进有用关注 Fable
模型Agent 与开发者多源确认73°04:13Anthropic发布Claude Fable 5.1模型Anthropic刚发了Fable 5.1,专门处理复杂任务,比之前的版本更强了。#Claude#Fable#Anthropic#编程助手10 个信源在谈事件专题Mike Krieger@mikeyk11 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型中美对照多源确认73°04:04大公司重视AI推理速度OpenAI、Google和Nvidia都在竞相提升AI模型推理速度,各有不同技术方案。#GPT 5.6#Gemini 3.7#Nemotron 3.5#推理模型10 个信源在谈事件专题DeepLearning.AI@DeepLearningAI11 个信源在谈原文稍后读已读值得跟进有用关注 GPT 5.6
模型中美对照多源确认73°03:45Claude发布Fable 5.1模型Claude新出的Fable 5.1比Opus 5成本更低,特别适合科学工作流,是日常使用的不错选择。#Claude#Fable 5.1#Opus 5#多模态3 个信源在谈事件专题elvis@omarsar04 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型Agent 与开发者多源确认78°02:47Anthropic发布Claude Fable 5.1和Claude Mythos 5.1Anthropic新推Claude Fable和Mythos 5.1,专为编程和知识工作设计,比前代更强。#Claude Fable 5.1#Claude Mythos 5.1#Anthropic#编程助手10 个信源在谈事件专题Claude@claudeai11 个信源在谈原文稍后读已读值得跟进有用关注 Claude Fable 5.1
模型02:25大模型纯扩展遭遇瓶颈,神经符号AI提供解决方案GaryMarcus指出纯扩展LLM已到极限,神经符号AI通过工具和约束解决了这一问题#LLM#神经符号AI#GaryMarcus#推理模型Gary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 LLM
模型中美对照78°23:13Z.ai GLM-5.3在CyberGym基准测试达84.5%Z.ai的GLM-5.3在安全测试基准上超越专有模型,仅靠微调实现,还因能力过强暂不公开权重。#GLM-5.3#Z.ai#CyberGym#推理模型DeepLearning.AI@DeepLearningAI原文稍后读已读值得跟进有用关注 GLM-5.3