8月1日
06:03
06:03Richard Socher@RichardSocher
精选
Claude的多数决策依赖细致的成本效益分析。Claude的硬约束则绝对且不可协商,任何操作员或用户都无法解锁。Claude硬约束的运作机制与它所考虑的其他优先级不同。
推荐理由:Richard Socher在推文中转述,Claude有些规则是死命令,操作员或用户都改不了,跟它平时的权衡式决策完全不一样。
03:11
03:11lmarena.ai@lmarena_ai
Thinking Machines 推出新模型 Inkling-Small。Inkling-Small 没有突破性能上限,但紧邻当前最强的几个模型。Thinking Machines 在官网发布了相关对比信息。
事件专题

推荐理由:Thinking Machines 新出的 Inkling-Small 虽然没登顶,但官方给了它和头部模型的对比图,想了解它大概什么水平可看。
01:55
01:55Google Gemini App@GeminiApp
72°
谷歌发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 升级版。新版本在推理能力和响应速度上均有提升。用户可在 gemini.google 或 App 的模型下拉菜单中切换使用。两个模型目前均已开放体验。
事件专题

推荐理由:谷歌把 Flash 和 Flash-Lite 都升级了,推理更强速度更快,打开 Gemini 选模型就能试。
00:49
7月31日
23:04
23:04官方一手歸藏(guizang.ai)@op7418
精选
DeepSeek 宣布 V4 Flash 0731 模型已开源。模型权重托管在 Hugging Face 的 deepseek-ai 组织下。该版本属于 Flash 系列,版本号为 0731。开发者可以下载权重进行本地部署或二次开发。
推荐理由:DeepSeek 把 V4 Flash 0731 的开源权重放出来了,想本地跑模型的话直接去 Hugging Face 下载就行。
22:14
20:19
20:19AI Will@FinanceYF5
DeepSeek-V4-Flash官方API已进入公开测试阶段。输入每百万Token仅0.28美元,输出价格为0.87美元。其Agent能力大幅升级,基准成绩全面超过V4-Pro-Preview。新版本原生支持Responses API格式,并完全适配Codex。
事件专题

推荐理由:DeepSeek的V4-Flash刚上线,API便宜到离谱,输入才0.28美元,性能还压过V4-Pro-Preview,搭Agent直接用它。
20:08
20:08AI Will@FinanceYF5
精选79°
DeepSeek V4 Flash 官方API现已开启公测,重点升级Agent能力。Terminal Bench 2.1得分82.7,DeepSWE得分54.4,多项成绩大幅超过V4 Pro Preview。该模型还接近Opus 4.8的表现,并原生支持Responses API格式,现已适配Codex。

推荐理由:DeepSeek V4 Flash 公测了,Agent 跑分比 V4 Pro 高不少,还原生支持 Responses API,玩 Codex 的可以直接试。
19:02
19:02官方账号阿里通义 Qwen@Alibaba_Qwen
精选
阿里云推出ASR模型Qwen-Audio-3.0-ASR-Flash,主打上下文一致性和领域术语识别。内部测试中,医疗术语召回率达95.36%,工业术语召回率达93.24%。该模型支持自定义热词,并可将语音润色为结构化文本。同步提供流式与文件转写两个版本。
事件专题

推荐理由:语音识别总听错专业词?试试这个新模型,医疗术语召回95.36%,还能自定义热词和输出结构化文本。
18:08
18:08orange.ai@oran_ge
DeepSeek V4 Flash 已上架 Cola 平台,支持 Token Plan 和积分模型两种计费方式。该模型的智能表现被描述为超过 GLM 5.2,接近 GPT 5.6 Luna。目前用户可通过 colaos.ai 免费体验这一模型。
事件专题

推荐理由:DeepSeek V4 Flash 在 Cola 上线了,免费就能玩,智能比 GLM 5.2 强,都快赶上 GPT 5.6 Luna了。
17:41
17:41向阳乔木@vista8
精选
DeepSeek-V4-Flash的官方API已进入公开测试。其Agent能力基准分数远超V4-Pro-Preview。该版本原生支持Responses API格式。同时完全适配Codex,开发者可在DeepSeek官方文档查看配置详情。
事件专题

推荐理由:DeepSeek把V4-Flash的API放出来了,Agent能力比V4-Pro-Preview还猛,而且直接支持Codex,开发者快去试试。
15:59
15:59AI Will@FinanceYF5
72°
有人在 X 上让 Claude 5 Opus 从零生成越野车和泥地赛道,全程不使用任何贴图。车身、轮胎、尘土和环境都由模型直接绘制,没有调用现成素材。这条演示推文附带视频,目前浏览量达 535 次。
推荐理由:有人让Claude 5 Opus零贴图直接画越野车和泥地赛道,连尘土都是生成的,视频看看效果。
15:45
15:45官方一手歸藏(guizang.ai)@op7418
72°
DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。
事件专题

推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。
15:40
15:40官方账号深度求索 DeepSeek@deepseek_ai
DeepSeek-V4-Flash 官方 API 现已进入公开测试版,Agent 能力获得升级。官方基准成绩显示其已远超 V4-Pro-Preview。该 API 原生支持 Responses API 格式,并已完全适配 Codex。具体配置方法见官方文档 api-docs.deepseek.com/quick_start/ag...
事件专题

推荐理由:DeepSeek把V4-Flash的API开放公测了,Agent能力比V4-Pro-Preview强不少,还直接适配Codex,想试新模型可以去看看。
15:23
13:53
13:53官方账号Greg Brockman@gdb
76°
GPT-5.6 Sol 找到了 Maxwell 猜想的反例,证实该猜想错误。这一猜想已存在超过 100 年,反例由 AI 发现后经人类数学家确认,论文已上传至 arXiv(编号 2607.27197)。成果展示了 GPT-5.6 Sol 在数学推理上的具体能力。
推荐理由:GPT-5.6 Sol 直接给 Maxwell 猜想找出了反例,人类数学家还验证了,这推理能力真有点吓人。
12:21

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。