7月17日
08:09
04:21
04:21Paul Couvert@itsPaulAi
73°
Kimi K3由Kimi.ai发布,拥有2.8T参数和1M上下文窗口。在编程和智能体任务上表现领先,部分指标超越Fable 5和GPT-5.6 Sol。定价与Sonnet 5相同,但推理成本更低。在前端设计竞技场首次登顶。
事件专题

推荐理由:Kimi K3开源了,2.8T参数比Fable 5还便宜,编码和智能体任务很强,试试看。
04:09
04:09Ethan Mollick@emollick
一项新基准测试要求AI一次性程序化生成不同历史时期的港口城镇文件。目前已有GPT-5.6 Pro、Fable、Kimi K3和Inkling四个模型参与。作者提供了所有模拟的可交互链接。该基准被认为能出人意料地反映模型能力。
事件专题

推荐理由:想看看不同AI在一次性生成复杂历史场景上的表现?这里有GPT-5.6 Pro、Fable、Kimi K3和Inkling的对比,还能自己玩模拟。
02:54
7月16日
23:13
13:43
12:39
12:39Junyang Lin@JustinLin610
Thinking Machines 推出名为 Inkling 的新模型,支持文本、图像和音频三种模态的推理。Inkling 的完整权重已开放,可在 Tinker 平台进行微调。用户还能通过 Inkling Playground 直接体验模型。该模型发布后获得了社区关注,原推文作者点赞其新架构。
事件专题

推荐理由:Thinking Machines 发了 Inkling,一个能看图文听音频的推理模型,而且权重全开放,能自己微调,还能在 Playground 试玩。
10:40
10:40官方账号arXiv cs.AI@Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li
Deep Interaction 是一种针对大推理模型的人机交互方法,允许用户直接编辑 Chain-of-Thought (CoT) 推理中的错误步骤。该方法将编辑后的 CoT 精炼为蒸馏提示,引导模型沿校正路径推理。在 STEM 任务上,纠正成功率提升超过 25%,token 使用减少约 40%。实验基于多个 STEM 推理基准,展示了显著的效率提升。
推荐理由:这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
03:39
03:39Lilian Weng@lilianweng
Thinking Machines 发布 Inkling 模型,提供完整开源权重。该模型在文本、图像、音频三种模态上均具备高效推理能力。用户可在 Tinker 平台上直接进行微调。基准性能覆盖广泛能力类别,适合实际应用与定制开发。
事件专题

推荐理由:Thinking Machines 开源了 Inkling,能同时处理文本、图像和音频,还能在 Tinker 上微调,挺实用的。
7月15日
09:26
09:26官方账号arXiv cs.AI@Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi, Kai Yamashita, Masahiro Suzuki, Yutaka Matsuo
论文提出Visual Access Sweep方法,通过遮蔽生成token到图像token的注意力,定义Visual Access Boundary (VAB)。在Qwen2.5-VL-32B和InternVL3的14B、38B规模上,CoT的VAB层与无CoT全访问目标差异最多两层。CoT提升受限于感知读出:当视觉属性可可靠读出时CoT有效,否则无效。符号属性oracle显示,提供真实属性文本后CoT可改善计数。单目标探针-解码检查表明,困难属性可从隐藏状态线性恢复但模型难以输出。
推荐理由:这篇论文用实验告诉你,视觉语言模型做CoT推理时,图像其实只在开头看一次,后面全靠语言处理。想知道为什么CoT有时没用?进来看看
05:49
05:49官方账号Meta AI@AIatMeta
72°
Meta AI 提交其推理与多模态模型参加了亚洲物理奥林匹克(APhO)理论考试。该模型取得满分 30/30 的成绩,与排名前三的学生选手并列。APhO 委员会允许该模型参赛,展示其在复杂物理推理任务上的能力。

推荐理由:Meta 的模型在物理奥赛里拿了满分,和前三名人类选手并列,看看AI的理科能力有多强。
00:55
7月14日
12:39
12:39官方账号Greg Brockman@gdb
OpenAI 的 GPT-5.6 系列模型(Sol、Terra、Luna)正式在 Amazon Bedrock 上全面可用。该系列提供三个智能层级,从旗舰推理(Sol)到快速推理(Luna)。基于 Bedrock 的下一代推理引擎,支持高性能、安全、规模和可靠性。开发者可直接在 AWS 上调用这三种模型。
事件专题

推荐理由:OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。