模型Agent 与开发者71°16:46推理成本降低不应止步Ilya新公司SSI将突破推理边界,Fable模型还有改进空间#SSI#Ilya#推理模型#FableBindu Reddy@bindureddy原文稍后读已读值得跟进有用关注 SSI
模型Agent 与开发者精选13:17Apple发布LoopCD模型Apple新发布的LoopCD模型,减少循环次数还能提升性能,AIME成绩提升超11个百分点。#LoopCD#Apple#AIME#循环神经网络1 个信源在谈事件专题Aran Komatsuzaki (论文推介)@arankomatsuzaki2 个信源在谈原文稍后读已读值得跟进有用关注 LoopCD
论文Agent 与开发者精选11:09MoE-CORE系统优化内存受限MoE推理MoE-CORE系统解决了MoE模型在内存受限设备上的推理问题,性能比vLLM Prefetch提升30倍。#MoE-CORE#DeepSeek-V4-Flash-W4A8#GLM-5.2-W4A8C8#推理模型aarXiv: DeepSeek@Ke Yang 等 19 人原文稍后读已读值得跟进有用关注 MoE-CORE
论文Agent 与开发者精选09:58SLIDER框架解析大语言模型推理过程清华团队推出SLIDER框架,能精准检测模型推理冗余,用Trajectory-RRI选数据可提升推理效率#SLIDER#Step-RRI#Trajectory-RRI#推理模型aarXiv: DeepSeek@Barproda Halder 等 3 人原文稍后读已读值得跟进有用关注 SLIDER
模型Agent 与开发者多源确认83°04:23Claude Sonnet 5.5 在代码竞技场获第三名Anthropic 发布的 Claude Sonnet 5.5 在代码竞技场表现优异,性价比超高,比前代版本提升 159 分。#Claude#Sonnet 5.5#Code Arena#Anthropic10 个信源在谈事件专题lmarena.ai@lmarena_ai11 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型Agent 与开发者多源确认精选73°04:11阿里Qwen3.8-27B模型ARC-AGI评测结果阿里Qwen3.8-27B在ARC-AGI评测中表现亮眼,v1得分87.5%,成本仅0.22美元/任务。#Qwen3.8-27B#Alibaba_Qwen#ARC-AGI#推理模型3 个信源在谈事件专题官方账号ARC Prize@arcprize4 个信源在谈原文稍后读已读值得跟进有用关注 Qwen3.8-27B
模型Agent 与开发者78°04:09Google 发布 Gemini 4 Argon 前沿模型Google 新出的 Gemini 4 Argon 模型,专精复杂领域,百万 token 输出,网络安全团队已抢先体验。#Gemini#Gemini 4 Argon#Google#推理模型Techsauce@ Techsauce Team 原文稍后读已读值得跟进有用关注 Gemini
模型Agent 与开发者83°03:57TwIL-LM3-Pro小模型展现强大推理能力webAI开源的TwIL-LM3-Pro小模型在推理任务上表现优异,3.6B参数就能跑本地,比同类模型高出一大截。#TwIL-LM3-Pro#webAI#推理模型#开源模型elvis@omarsar0原文稍后读已读值得跟进有用关注 TwIL-LM3-Pro
模型Agent 与开发者18:54Gemini 4 Argon或助谷歌重返AI前沿谷歌发布了Gemini 4 Argon,这是他们重返AI前沿的最新尝试,值得关注其性能表现。#Gemini#Google#Gemini 4 Argon#推理模型The Rundown AI@therundownai原文稍后读已读值得跟进有用关注 Gemini
模型Agent 与开发者精选73°12:56Looped Diffusion Transformer模型发布新发布的Looped Diffusion Transformer模型比大6.5倍的模型表现更好,计算需求却低4.9倍,效率惊人。#Looped Diffusion Transformer#T2I#图像生成#推理模型Aran Komatsuzaki (论文推介)@arankomatsuzaki原文稍后读已读值得跟进有用关注 Looped Diffusion Transformer
模型Agent 与开发者12:40Looped Diffusion Transformer研究发布OpenAI团队发布Looped-DiT,260M参数模型性能超越6.5倍大模型,计算效率提升4.9倍。#Looped-DiT#Diffusion Transformer#文本到图像#推理模型aarXiv cs.LG@Yong Xien Chng 等 10 人原文稍后读已读值得跟进有用关注 Looped-DiT
论文Agent 与开发者11:08Semifactual Credit-Augmented Policy OptimizationSCAPO算法通过半事实稳定性改进了令牌级信用分配,在数学和分布外基准上表现优异。#SCAPO#GRPO#Qwen3#强化学习aarXiv cs.AI@Junshu Pan 等 8 人原文稍后读已读值得跟进有用关注 SCAPO
论文Agent 与开发者10:33基于感知优势估计的多模态推理强化方法TPAE方法通过细粒度监督提升多模态模型推理能力,在七个基准测试中表现优异。#TPAE#多模态#强化学习#MLLMsaarXiv cs.AI@Zhihan Zhang, Lizi Liao原文稍后读已读值得跟进有用关注 TPAE
模型Agent 与开发者精选73°09:50webAI发布TwIL-LM3-Pro推理模型webAI新推的3.66B参数模型,主打形式逻辑推理,小体积就能跑,性能还超过多个大模型。#TwIL-LM3-Pro#webAI#推理模型#形式逻辑shao__meng@shao__meng原文稍后读已读值得跟进有用关注 TwIL-LM3-Pro
论文Agent 与开发者09:50T-Router:基于参数高效强化学习的推理路由方法T-Router用不到0.5%的参数就让大模型推理能力提升近10个点,比LoRA和全参数训练都强。#T-Router#参数高效强化学习#推理模型#GSM8KaarXiv cs.AI@Liuxian Ma 等 4 人原文稍后读已读值得跟进有用关注 T-Router
模型Agent 与开发者精选08:46韩国Upstage发布Solar Mini 4模型Upstage的Solar Mini 4在3B活跃参数模型中表现优异,但任务成本是GPT-6 Luna的5倍,知识准确率较低。#Solar Mini 4#Upstage#推理模型#长上下文1 个信源在谈事件专题官方账号Artificial Analysis@ArtificialAnlys2 个信源在谈原文稍后读已读值得跟进有用关注 Solar Mini 4
模型中美对照多源确认83°08:33Google发布Gemini 4 Argon模型Google的Gemini 4 Argon在编程能力上有显著提升,代码基准测试超越主要竞争对手,还优化了内存使用和价格策略。#Gemini#GPT-6#Claude#编程助手10 个信源在谈事件专题Blognone@mk11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型Agent 与开发者多源确认87°08:06Google发布Gemini 4 Argon模型Google终于发布Gemini 4,百万token输出上限,多项基准测试领先,还能帮你写代码找漏洞。#Gemini 4#Google#推理模型#长文本处理10 个信源在谈事件专题berryxia@berryxia11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini 4
模型中美对照多源确认83°06:46谷歌发布Gemini 4 Argon模型谷歌新推的Gemini 4 Argon在推理能力和长任务处理上表现出色,内存优化案例释放了300 TiB,API定价也很有竞争力。#Gemini#Gemini 4 Argon#GPT-6#推理模型10 个信源在谈事件专题岚叔@lufzzliz11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型Agent 与开发者多源确认83°05:35Cognition成首个NVIDIA Vera Rubin客户Cognition用上了NVIDIA最新Vera Rubin芯片,性能比前代提升近5倍,专门为更好的AI智能体设计。#NVIDIA#Vera Rubin#Cognition#CoreWeave10 个信源在谈事件专题Cognition@cognition_labs11 个信源在谈原文稍后读已读值得跟进有用关注 NVIDIA
模型中美对照73°05:22美国TwIL-LM3-Pro超越中国VibeThinker-3B美国3.66B模型TwIL-LM3-Pro在形式逻辑测试中大幅领先中国VibeThinker-3B等模型,且支持本地运行。#TwIL-LM3-Pro#VibeThinker-3B#webAI#推理模型rohanpaul_ai@rohanpaul_ai原文稍后读已读值得跟进有用关注 TwIL-LM3-Pro
模型中美对照多源确认83°04:58Gemini 4 在AAI指数表现优异Gemini 4在多个基准测试中表现优异,特别是低幻觉率值得关注。#Gemini#GPT-6#AAI#基准测试10 个信源在谈事件专题kimmonismus@kimmonismus11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认83°04:31Google发布Gemini 4 Argon模型Google新模型Gemini 4 Argon性能媲美GPT-6 Astra但成本更低,幻觉率最低,智能体能力大幅提升。#Gemini 4 Argon#GPT-6 Astra#GoogleDeepMind#推理模型10 个信源在谈事件专题官方账号Artificial Analysis@ArtificialAnlys11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini 4 Argon
模型中美对照多源确认89°04:26OpenAI发布GPT-6.1 Sol模型OpenAI新模型GPT-6.1 Sol在ARC-AGI测试中表现优异,成本比前代低77%,性价比突出。#GPT-6.1 Sol#OpenAI#ARC-AGI#推理模型10 个信源在谈事件专题官方账号ARC Prize@arcprize11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型Agent 与开发者83°04:20谷歌发布Gemini 4 Argon模型谷歌新发布的Gemini 4 Argon能处理百万token长文本,在软件工程和企业知识工作方面表现突出。#Gemini#Gemini 4 Argon#Google#推理模型官方账号Google AI@GoogleAI原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认83°04:17Google发布Gemini 4 Argon模型Google新发布的Gemini 4 Argon在多个基准测试中击败竞品,专攻企业级复杂任务。#Gemini#Google#Gemini 4 Argon#推理模型10 个信源在谈事件专题TestingCatalog@testingcatalog11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini+1
模型Agent 与开发者多源确认02:46OpenAI CoT 演进方向分析OpenAI 的 CoT 技术演进路线清晰,想知道他们如何一步步提升模型推理能力的可以看看。#OpenAI#CoT#GPT-OSS#推理模型10 个信源在谈事件专题Teortaxes@teortaxesTex11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
模型Agent 与开发者多源确认01:35Fireworks推出Ember-1模型,推理效率接近Kimi K3Fireworks新出的Ember-1模型,比Kimi K3更省token,成本更低,速度更快。#Ember-1#Kimi K3#Fireworks#推理模型5 个信源在谈事件专题Fireworks AI@FireworksAI_HQ6 个信源在谈原文稍后读已读值得跟进有用关注 Ember-1
模型中美对照多源确认00:58OpenAI发布GPT-6.1 Sol模型OpenAI新出的GPT-6.1 Sol,性能接近顶级版本但便宜5倍,速度还快8倍,适合编程和分析工作。#GPT-6.1 Sol#OpenAI#GPT-6#推理模型10 个信源在谈事件专题Techsauce@ Techsauce Team 11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型Agent 与开发者多源确认23:25OpenAI推理之父谈数学与多智能体OpenAI推理主管分享对多智能体系统的真实看法,数学难题突破中Agent实际贡献远低于预期。#OpenAI#多智能体#推理模型#数学问题10 个信源在谈事件专题量子位@衡宇11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
模型中美对照多源确认83°19:53OpenAI 发布 GPT-6.1 Sol 定价仅为 Astra 的五分之一OpenAI 推出 GPT-6.1 Sol,性能接近 Astra 但价格只有其五分之一,现已通过 API 和 ChatGPT Work 推出。#GPT-6.1 Sol#OpenAI#Astra#推理模型10 个信源在谈事件专题Blognone@arjin11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型Agent 与开发者多源确认72°19:34OpenAI Ultrafast实际使用Nvidia芯片OpenAI Ultrafast实际用的是Nvidia芯片,不是之前说的Cerebras,性能可能还有提升空间。#Ultrafast#OpenAI#Nvidia#推理模型10 个信源在谈事件专题@koltregaskes@koltregaskes11 个信源在谈原文稍后读已读值得跟进有用关注 Ultrafast
模型Agent 与开发者多源确认78°11:49Claude 5.5 发布Anthropic 刚发布了 Claude 5.5,在多项基准测试中表现优异,复杂推理能力有显著提升。#Claude#Claude 5.5#Anthropic#推理模型10 个信源在谈事件专题Teortaxes@teortaxesTex11 个信源在谈原文稍后读已读值得跟进有用关注 Claude+1
模型Agent 与开发者精选10:44MetaCtrl:大模型元认知控制器提升推理效率MetaCtrl 让大模型在保持准确率的同时大幅减少推理步骤,无需重新训练原模型就能直接使用。#MetaCtrl#DeepSeek-R1-Distill-Qwen-7B#Qwen3-14B#推理模型aarXiv: DeepSeek@Zhibin Wen 等 5 人原文稍后读已读值得跟进有用关注 MetaCtrl
论文Agent 与开发者10:24探索广度与推理精度:通过采样提升小模型性能新PPT方法让小模型通过并行采样达到前沿性能,比强化学习训练更高效。#Power Tempering#LLM#推理模型#采样方法aarXiv cs.LG@Panagiotis Theodoropoulos 等 7 人原文稍后读已读值得跟进有用关注 Power Tempering
模型中美对照多源确认83°08:27OpenAI发布GPT-6.1 Sol模型OpenAI刚发布了GPT-6.1 Sol,错误率大幅降低,性能接近Astra,值得关注。#GPT-6.1#OpenAI#Astra#推理模型10 个信源在谈事件专题Tech in Asia@Naomi Li Gan11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1
模型中美对照多源确认83°05:35OpenAI发布GPT-6.1 Sol模型OpenAI新出的GPT-6.1 Sol,价格便宜又好用,直接对标Sonnet 5.5#GPT-6.1#OpenAI#Sonnet 5.5#推理模型10 个信源在谈事件专题kimmonismus@kimmonismus11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1+1
模型Agent 与开发者多源确认72°04:17GPT-6.1 Sol 已集成到 ClineCline 集成了 GPT-6.1 Sol,成本只有 GPT-6 Astra 的五分之一,性能相当。#GPT-6.1 Sol#Cline#DeepSWE#推理模型10 个信源在谈事件专题Cline@cline11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
产品Agent 与开发者官方一手04:00GPT-6.1 Sol 登陆 Amazon BedrockAWS 推出了 GPT-6.1 Sol,在 Bedrock 上提供接近 Astra 的智能,特别适合编程和专业工作场景。#GPT-6.1 Sol#Amazon Bedrock#AWS#推理模型10 个信源在谈事件专题官方一手AWS Machine Learning Blog@Tanvi Girinath11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol
模型Agent 与开发者官方一手83°03:33GPT-6.1 Sol 减少事实错误响应OpenAI 新版 GPT-6.1 Sol 事实错误减少 32%,安全审查未被绕过,比前代更可靠。#GPT-6.1 Sol#OpenAI#事实准确性#推理模型10 个信源在谈事件专题官方一手@OpenAIDevs@OpenAIDevs11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6.1 Sol