8月1日
17:57
17:57官方一手marktechpost@Michal Sutter
Supabase开源了Apache-2.0许可的基准框架supabase/evals。该框架让Claude Code、Codex和OpenCode在容器化环境中执行真实Supabase任务,例如构建schema、调试Edge Functions、修复RLS策略。评分结合确定性检查与LLM-as-a-judge。
事件专题

推荐理由:Supabase开源Evals,用真实任务评估Claude Code等编码智能体,比普通基准更实战
16:35
16:35官方账号Decoder@Matthias Bastian
82°
OpenAI正在开发代号Astra的模型家族,其设计目标是让多个智能体协同处理复杂问题,运行时长可达数小时甚至数天。CEO Sam Altman已在华盛顿向政策制定者演示了Astra。OpenAI尚未决定将其作为GPT-6还是新GPT-5变体发布。
事件专题

推荐理由:OpenAI在做Astra模型家族,多个智能体能协作数小时甚至数天,可能叫GPT-6或GPT-5。
02:05
01:08
01:08官方账号Decoder@Thomas Joos
DeepSeek V4 Flash 的 0731 更新版本在 Artificial Analysis Intelligence Index 上得分 50,较前版提升 10 分。该分数仅比 OpenAI GPT-5.6 Luna 低 1 分,但每任务成本约低 60%。这一成绩让 DeepSeek 的平价模型在性能逼近旗舰的同时,展现出明显的成本优势。
事件专题

推荐理由:DeepSeek 把 V4 Flash 升到 0731 版,性能只比 GPT-5.6 Luna 低 1 分,成本却省六成,平价模型也能打了。
7月31日
16:21
16:21官方一手pandaily@contact@pandaily.com (Pandaily)
Kimi K3技术报告披露了MoonEP、KDA和AttnRes三套基础设施方案。报告强调MFU对训练效率的关键作用。Moonshot AI认为专家并行与共享专家的工程实现是真正壁垒。这些经验让开源模型的经济优势难以被复制。
事件专题

推荐理由:Moonshot AI公开了Kimi K3的MoonEP等设计,但真正难抄的是工程调优经验,这决定了开源模型能不能打。
14:14
14:14官方账号Latent Space (swyx)博客/媒体
OpenAI将GPT 5.6价格下调20%-80%。由于GPT 5.6的递归自我优化,GPT 5.4的智能成本在4个月内下降了13倍。蒸馏技术在其中起到关键作用。
事件专题

推荐理由:GPT 5.6大幅降价,最高降八成,四个月前GPT 5.4的算力成本现在只要十三分之一,做AI应用的成本压力能小不少。
11:00
11:00IT之家博客/媒体
精选
Openchip于7月30日公布了基于亚2纳米GAA制程的BER10处理器,开发用时2.5年,定位工业级芯片。该处理器集成4个64位乱序核心,配备宽矢量处理单元,支持多通道内存,兼容Linux系统。Openchip后续还将开发面向数据中心超算和AI的RISC-V计算加速器。

推荐理由:欧洲芯片公司Openchip出了个RISC-V服务器芯片BER10,用亚2纳米工艺,能跑实际工作负载,还兼容Linux,想做AI/HPC的老本行。
10:01
10:01官方一手pandaily@contact@pandaily.com (Pandaily)
Kimi K3 是 Moonshot AI 开源的 2.8T 参数模型,也是目前最大的开放权重模型。发布两天内因访问量过大导致服务短暂过载。该模型上线后占全球开源下载量的 41%,海外付费用户增长 4 倍,API 收入增长 400%。
事件专题

推荐理由:Moonshot 开源的 Kimi K3 有 2.8T 参数,是目前最大开源权重模型,一上线就过载,海外付费和 API 收入都翻了几倍。
08:30
08:30官方账号Simon Willison’s Weblog博客/媒体
81°
OpenAI宣布GPT-5.6 Terra降价20%,GPT-5.6 Luna降价80%。Luna输入价格降至$0.20/百万token,输出$1.20/百万token,低于Google Gemini 3.1 Flash-Lite的$0.025/$1.50。Anthropic Claude Haiku 4.5输入/输出为$1/$5,Luna输入成本仅为Haiku的1/5。OpenAI使用GPT-5.6 Sol优化负载均衡和推理内核,将端到端服务成本降低20%。
事件专题

推荐理由:OpenAI把Luna价格打到比Gemini Flash-Lite还低,想省钱换模型?Luna现在比Claude Haiku便宜5倍,跑demo或生产都能省一大笔。
06:44
06:44官方账号OpenAI@OpenAI (@OpenAI)
ARC-AGI-3基准测试要求模型无需指令学习不熟悉的2D游戏。标准测试丢弃了GPT-5.6 Sol每步后的推理,并在上下文填满时丢弃早期动作。这导致模型无法积累有效经验,只能不断重启。测试结果凸显了长上下文维持对推理模型的关键性。
事件专题

推荐理由:ARC-AGI这个测试挺刁钻,GPT-5.6 Sol在没法记住之前推理的情况下学不会新游戏,说明长上下文对推理很重要。
01:40
01:40官方账号OpenAI@OpenAI (@OpenAI)
81°
OpenAI 通过 GPT-5.6 Sol 实现自身运行效率提升,使服务成本降低 20%。改进推测解码后,令牌生成效率提升 15% 以上。这些优化已转化为 Luna 和 Terra 模型的 API 价格下调。OpenAI 旨在让先进智能更普及。
事件专题

推荐理由:OpenAI 又升级了,GPT-5.6 Sol 让运行成本降了20%,速度快了15%,Luna 和 Terra 也降价了,开发者快看。
01:26
01:26官方一手marktechpost@Asif Razzaq
80°
Google DeepMind推出Gemini Robotics 2,包含三个模型:一个视觉-语言-动作模型用于全身人形控制,Gemini Robotics ER 2用于具身推理与任务编排,以及一个设备端VLA可在数小时内适应新机器人躯体。单一检查点驱动Apptronik Apollo 2和Franka Duo两款机器人。仅ER 2模型公开发布。
事件专题

推荐理由:DeepMind发了三个机器人模型:一个控全身,一个做推理,一个快速适应新身体。只公开了ER 2,感兴趣可以直接试。
7月30日