产品11:26磐镭发布 YO2 迷你主机进阶版预告磐镭升级了 YO2 迷你主机,换上更强的 495 处理器和 192GB 内存,推理速度更快,还保留了酷炫灯带。#磐镭#YO2#AMD锐龙AI#迷你主机IIT之家原文稍后读已读值得跟进有用关注 磐镭
论文11:21思维链推理中可读性与可解释性的差异研究思维链文本的可读性不等于可解释性,研究揭示了LLM判断推理步骤重要性的局限性。#思维链#可解释性#LLM#推理模型aarXiv cs.LG@Kevin Du 等 4 人原文稍后读已读值得跟进有用关注 思维链
模型中美对照多源确认73°10:11OpenAI Astra模型应用于AI工程任务OpenAI的Astra模型每小时不到6美元,能完成从数据标记到系统部署的全套AI工程任务,还能协调子智能体。#Astra#OpenAI#AI工程#智能体10 个信源在谈事件专题Latent.Space@latentspacepod11 个信源在谈原文稍后读已读值得跟进有用关注 Astra
模型中美对照多源确认93°10:11OpenAI发布GPT-6 Astra群星模型OpenAI的GPT-6 Astra在科研推理上大幅领先,但编程能力提升有限,与竞品差距不大。#GPT-6#Astra#OpenAI#推理模型10 个信源在谈事件专题orange.ai@oran_ge11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认93°10:11OpenAI发布GPT-6 Astro群星模型OpenAI的GPT-6 Astro在科研领域大幅领先,但编程能力与上一代持平,定价10in 50out。#GPT-6#Astro#OpenAI#AGI10 个信源在谈事件专题orange.ai@oran_ge11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认73°10:11GPT-6 Astra在ARC-AGI-3基准表现优异GPT-6 Astra在ARC-AGI-3上展示了符号世界模型的力量,能记录状态并执行精确计划#GPT-6#Astra#ARC-AGI-3#符号世界模型10 个信源在谈事件专题Gary Marcus@GaryMarcus11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照官方一手78°10:11GPT-6 Astra发布但暂不可用OpenAI的GPT-6 Astra虽暂不能用,但展示了超长任务处理和强大3D建模能力,成本还比Claude低一半。#GPT-6#Astra#OpenAI#3D建模10 个信源在谈事件专题官方一手歸藏(guizang.ai)@op741811 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认73°10:10GPT-6 Astra在WANDR评测中获最高分GPT-6 Astra在WANDR评测中击败多个竞品,性价比突出。#GPT-6 Astra#WANDR#推理模型10 个信源在谈事件专题官方账号Perplexity@perplexity_ai11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6 Astra
模型多源确认73°10:10Stanford AI实验室发布Astra模型Stanford团队的新模型Astra比5.6版本更严格遵循指令,但需要清理旧技能中的不必要指令。#Astra#StanfordAILab#YannDubois#推理模型10 个信源在谈事件专题Stanford AI Lab@StanfordAILab11 个信源在谈原文稍后读已读值得跟进有用关注 Astra
模型中美对照多源确认73°10:10Astra模型创ECI新纪录169分OpenAI的Astra在多个基准测试中创纪录,但ECI分数仍在趋势线内,GPT-6距离AGI仍有差距。#Astra#GPT-6#OpenAI#ECI10 个信源在谈事件专题Gary Marcus@GaryMarcus11 个信源在谈原文稍后读已读值得跟进有用关注 Astra
模型中美对照多源确认精选73°10:10OpenAI GPT-6 Astra 引发争议OpenAI 的 GPT-6 Astra 在 ARC-AGI 测试中表现亮眼,但专家对其是否真正实现 AGI 提出质疑。#GPT-6#Astra#OpenAI#ARC-AGI10 个信源在谈事件专题Gary Marcus@GaryMarcus11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认精选73°10:10GPT-6 Astra 展示符号世界建模能力GPT-6 Astra 能自己创建符号世界模型,在推理任务上接近满分,比人类还高效。#GPT-6#Astra#符号世界模型#ARC-AGI-310 个信源在谈事件专题Gary Marcus@GaryMarcus11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认73°10:01OpenAI发布GPT-6 Astra模型OpenAI新出的GPT-6 Astra在多个数学和科学基准上刷新记录,特别适合科研和小团队使用。#GPT-6#Astra#OpenAI#科学发现10 个信源在谈事件专题官方账号Greg Brockman@gdb11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认73°10:01OpenAI的Astra模型在ARC-AGI-3基准上取得突破OpenAI的Astra在ARC-AGI-3上达到99%分,96%关卡超越人类,表现惊艳。#GPT-6#Astra#OpenAI#ARC-AGI10 个信源在谈事件专题官方账号Greg Brockman@gdb11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认73°05:10GPT-6 Astra与Claude Fable 5.1对比评测OpenAI的GPT-6 Astra与Claude Fable 5.1的3D生成能力对比,详细展示了不同推理级别的影响。#GPT-6 Astra#Claude Fable 5.1#OpenAI#3D生成10 个信源在谈事件专题lmarena.ai@lmarena_ai11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6 Astra
模型中美对照多源确认05:01Astra计算图深度接近GPT-4OpenAI解释Astra计算图深度与GPT-4的关系,强调思维链监控的重要性与挑战。#Astra#GPT-4#OpenAI#思维链监控10 个信源在谈事件专题Gary Marcus@GaryMarcus11 个信源在谈原文稍后读已读值得跟进有用关注 Astra
产品Agent 与开发者多源确认73°04:47GPT-6 Astra将接入Devin平台Cognition公司把GPT-6 Astra带到Devin,性能接近Fable 5但成本更低,测试报告质量也更好。#GPT-6#Devin#Astra#编程助手10 个信源在谈事件专题Cognition@cognition_labs11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认73°04:36GPT-6 Astra发布OpenAI发布了GPT-6 Astra,多项基准测试接近满分,专业工作能力突出。#GPT-6#Astra#OpenAI#推理模型10 个信源在谈事件专题官方账号Sam Altman@sama11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照官方一手73°04:22GPT-6 Astra 发布,DeepSWE v1.1 得分 75.2%OpenAI 发布了 GPT-6 Astra,它在代码修复任务中表现出色,能完整处理从 bug 分析到修复的全流程。#GPT-6#Astra#DeepSWE#推理模型10 个信源在谈事件专题官方一手@OpenAIDevs@OpenAIDevs11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照官方一手73°04:22GPT-6 Astra在OSWorld 2.0离线测试中获72.6%分OpenAI的GPT-6 Astra首次在离线桌面任务测试中突破72%大关,能自主操作应用程序并切换代码模式。#GPT-6#Astra#OSWorld#桌面任务10 个信源在谈事件专题官方一手@OpenAIDevs@OpenAIDevs11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认93°03:55GPT-6 Astra正式发布OpenAI发布了GPT-6 Astra,比前代推理能力更强,上下文更长,现在就能体验。#GPT-6#Astra#OpenAI#推理模型10 个信源在谈事件专题官方账号Greg Brockman@gdb11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认93°02:41GPT-6 Astra发布,多项基准测试创纪录OpenAI的GPT-6 Astra在数学、科学、网络安全等领域创下新纪录,Greg Brockman称其标志着AGI时代的到来。#GPT-6#Astra#OpenAI#AGI10 个信源在谈事件专题The Rundown AI@therundownai11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型精选01:41Fable 5.1 (Max) 在 WebDev 领域领先137分Anthropic的Fable 5.1 (Max)在WebDev基准测试中大幅领先,六个领域五个第一,游戏和模拟领域提升超200分。#Fable 5.1#AnthropicAI#Code Arena#WebDevlmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 Fable 5.1
模型中美对照精选00:11GLM-5.3与DeepSeek-V4表现稳定GLM-5.3和DeepSeek-V4在AI模型竞争中保持稳定,值得关注这两款模型的最新进展。#GLM-5.3#DeepSeek-V4#推理模型#开源模型1 个信源在谈事件专题elvis@omarsar02 个信源在谈原文稍后读已读值得跟进有用关注 GLM-5.3
模型中美对照多源确认16:33DeepSeek 强大免费,挑战 OpenAI 与 AnthropicDeepSeek 模型免费且强大,成为 OpenAI 和 Anthropic 的有力竞争者,值得关注其发展。#DeepSeek#开源模型#智能体#AI安全10 个信源在谈事件专题Geek@geekbb11 个信源在谈原文稍后读已读值得跟进有用关注 DeepSeek
产品多源确认精选73°14:05Gemini-3.8-Flash上线Genspark平台Google发布Gemini 3.8 Flash,比前代仅三周就更新,推理和编码能力更强。#Gemini-3.8-Flash#Genspark#Google#推理模型10 个信源在谈事件专题Genspark@genspark_ai11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini-3.8-Flash
论文精选73°12:06Cliff:从首次错误中学习过程奖励研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。#Cliff#RLVR#强化学习#推理模型aarXiv cs.LG@Peixuan Han 等 6 人原文稍后读已读值得跟进有用关注 Cliff
论文精选73°11:50Trace as State:长上下文Transformer的条件状态更新DeepSeek和GLM-5.2通过将推理痕迹前置,长上下文推理准确率大幅提升,最高达100%。#Trace as State#DeepSeek V4 Pro Preview#GLM-5.2#长上下文aarXiv: DeepSeek@Xu Zou, Jie Tang原文稍后读已读值得跟进有用关注 Trace as State
论文73°11:42医疗问答中的误导上下文机制研究医疗AI研究团队发现模型对断言比对证据更易受影响,开放推理轨迹能更好检测错误决策。#MedMisBench#医疗问答#推理模型#LLM监控aarXiv cs.LG@Robin Linzmayer, Noémie Elhadad原文稍后读已读值得跟进有用关注 MedMisBench
模型Agent 与开发者78°10:14Muse Spark 1.3 发布Meta 推出了 Muse Spark 1.3,智能体和编码能力大幅提升,成本降低 25%,更适合生产环境使用。#Muse Spark#Meta AI#智能体#编码助手shao__meng@shao__meng原文稍后读已读值得跟进有用关注 Muse Spark
模型中美对照多源确认78°08:48Gemini 3.8 Flash 发布:接近前沿模型能力Google 发布了 Gemini 3.8 Flash,价格更低但性能接近前沿模型,成本效率大幅提升。#Gemini#Gemini 3.8 Flash#Opus 5#推理模型10 个信源在谈事件专题shao__meng@shao__meng11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型73°07:22西班牙推出Quasar 438B模型,欧洲最强AI西班牙公司推出欧洲最强AI模型Quasar 438B,1M词元上下文,比Mistral Medium 3.5得分高13。#Quasar 438B#Multiverse Computing#推理模型#长上下文IIT之家原文稍后读已读值得跟进有用关注 Quasar 438B
模型中美对照04:43Qwen3.6-35B-A3B 在 MacBook Pro 上性能测试Qwen3.6-35B-A3B 在苹果笔记本上跑得比 MLX-LM 还快,吞吐量提升超 20%,质量不打折。#Qwen3.6-35B-A3B#MLX-LM#MacBook Pro#性能基准官方账号Perplexity@perplexity_ai原文稍后读已读值得跟进有用关注 Qwen3.6-35B-A3B
产品04:43Lily适配苹果硅架构Perplexity开源了Lily项目,专门优化Qwen模型在苹果硅芯片上的推理性能。#Lily#Qwen#苹果硅#推理模型官方账号Perplexity@perplexity_ai原文稍后读已读值得跟进有用关注 Lily
产品中美对照04:23Muse Spark 1.3 版本发布Meta 推出了 Muse Spark 1.3,即将加入最大推理功能,安全测试后上线。#Muse Spark#Meta#Meta Model API#推理模型官方账号Meta AI@AIatMeta原文稍后读已读值得跟进有用关注 Muse Spark
模型中美对照多源确认73°04:22OpenAI新推理技术引发安全专家担忧OpenAI的Astra模型用'循环深度'技术突破顺序思维,安全专家对此表示担忧。#OpenAI#Astra#推理模型#AI安全10 个信源在谈事件专题techcrunch@Russell Brandom11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
模型Agent 与开发者多源确认03:38Gemini 3.8 Flash 登陆 Poe 平台Google 的 Gemini 3.8 Flash 登陆 Poe,速度快成本低,适合编程和智能体任务,还有百万上下文窗口。#Gemini#Gemini 3.8 Flash#Poe#推理模型10 个信源在谈事件专题Poe@poe_platform11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
产品多源确认73°01:35Gemini 3.8 Flash与AI SDK结合使用Google刚推出Gemini 3.8 Flash,比三周前的3.7 Flash更强,现在可以用AI SDK直接调用。#Gemini#Gemini 3.8 Flash#AI SDK#推理模型10 个信源在谈事件专题AI SDK@aisdk11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照01:13Google发布Gemini 3.8 Flash第三款经济模型Google六周连推三款经济模型,Gemini 3.8 Flash虽成本低但推理消耗高。#Gemini#Claude Opus 5#Google#推理模型官方账号Decoder@Matthias Bastian原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认73°00:40Gemini 3.8 Flash模型发布Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。#Gemini#Gemini 3.8 Flash#Google#推理模型10 个信源在谈事件专题Paul Couvert@itsPaulAi11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini