8月9日
06:19
7月22日
15:32
15:32@koltregaskes@koltregaskes
一位用户在X平台表示,经过一段时间使用后,认为GPT-5.6是自GPT-4相比GPT-3.5以来最明显的性能跳跃。该模型更善于按照指令完成任务,执行力显著增强。用户同时指出主要问题在于Codex(编程界面)仍需大量改进。
事件专题

推荐理由:有用户说GPT-5.6干活更利索比之前版本强一大截,但Codex还不够好,来看看他的体验。
7月11日
7月7日
17:00
17:00@koltregaskes@koltregaskes
精选
分析显示,前沿模型发布到可本地运行的类似开源模型平均滞后25个月。例如GPT-3到Llama 2 70B约37个月,GPT-4到Gemma 3/Qwen3约2年,Claude 3.5 Sonnet到Gemma 4 31B约21个月。趋势预示当前前沿能力可能在两年后出现在笔记本电脑级模型中。该图表预测Fable/Mythos级模型约2028年中出现。
事件专题

推荐理由:想了解前沿模型多久能变成你能在笔记本上跑的开源版?这篇用GPT-4、Claude 3.5等具体案例算出了平均25个月的滞后,还画了未来预测图。
12:20
12:20AI Will@FinanceYF5
根据r/LocalLLaMA的一张图表,有人计算了从云端顶尖模型发布到普通笔记本能运行同等能力水平的平均时间差为24.8个月。GPT-3用了37个月才被追上,GPT-3.5是17个月,GPT-4大约24个月。按此节奏推算,Fable/Mythos 5级别的能力预计在2028年7月可运行于高端消费级电脑。

推荐理由:有人拿LocalLLaMA的数据算了一笔账:顶级云端模型大概两年后就能在普通笔记本上跑,GPT-3.5只用了17个月,这个时间差挺有意思。
01:31
01:31官方账号Decoder@Matthias Bastian
GPT-4在Epoch Capabilities Index上保持领先约一年,远超其他模型。自2024年2月Claude 3 Opus登顶以来,榜首已易手17次,中位停留时间仅七周。当前模型间的竞争更激烈,但能力增益却在缩小。

推荐理由:AI模型排行榜大洗牌,GPT-4曾经稳坐一年,现在每七周就换龙头,竞争白热化但进步空间在缩水。
7月3日
10:59
6月23日
16:51
16:51官方一手Hugging Face: Blog博客/媒体
精选
Hugging Face将huggingface_hub库的发布频率从每两个月一次提升至每周一次。流程中利用GPT-4自动生成发布说明,通过GitHub Actions运行超过2000项测试,并由人类维护者进行最终审核。该方案使版本迭代速度提升8倍,同时保持稳定性。
推荐理由:Hugging Face分享了他们如何用GPT-4和GitHub Actions把库发布从两个月一次提速到每周一次,还保留了人工把关,挺实用的经验。
6月18日
03:01
03:01官方一手Anthropic: Research资讯
精选
Anthropic前沿红队发布研究,量化了GPT-4和Claude 3.5等大模型对N-day漏洞利用的效率影响。测试涉及多个已知漏洞样本,发现模型能显著缩短利用代码的编写时间。研究报告同时强调了当前安全对齐的不足,并给出了缓解建议。
事件专题

推荐理由:Anthropic自家红队实测,发现Claude和GPT-4都能帮人更快写出漏洞利用代码。想知道风险多大?看这篇。
5月27日
18:44
18:44宝玉@dotey
一篇对 Gemini 前核心科学家 Andrew Dai 的专访揭示,Google 在技术储备上其实早于 OpenAI:2021 年就做出了比 GPT-3 更强的 MoE 大模型 GLaM,PaLM 2 也在 2023 年初训练完成。但组织问题拖累了发布节奏——为了等 Google I/O,PaLM 2 被刻意延迟,而 OpenAI 抢先发布 GPT-4,改写了市场叙事。这解释了为什么 Gemini 2.5 Pro 之前,Google 模型从未超越 GPT-4。
事件专题

推荐理由:做 AI 产品战略或关注模型竞争的读者,这篇专访点出了技术领先不等于市场领先的残酷现实——Google 的组织惯性如何让先发优势变成后发劣势,值得所有技术团队反思。
5月25日
21:38
21:38官方账号Simon Willison@simonw
精选
Simon Willison 在 X 上指出,此前广为流传的“每生成一封邮件消耗一瓶水”的 GPT-4 水耗估算,很大程度上基于对 GPT-4 架构的猜测。他认为 OpenAI 有责任公布这个已退役的三年老模型的架构细节,以澄清事实。该言论引发了对 AI 模型环境影响估算准确性的讨论。
事件专题

推荐理由:AI 环境影响是开发者绕不开的话题,Simon Willison 戳破了 GPT-4 水耗估算的泡沫,做 AI 可持续性研究的团队值得关注。
5月18日
06:44
06:44Ethan Mollick@emollick
精选
Ethan Mollick在推文中透露,他们的实验使用了GPT-4和GPT-4o的混合模型,因为发表论文需要时间。他指出,如果使用更新的模型,尤其是最新的智能体工具,实验结果可能会更加显著。这表明AI技术的快速迭代对研究结果有重要影响,最新模型和工具能带来更大提升。
推荐理由:AI研究者或实验设计者注意了:模型版本差异可能显著影响结论,使用最新智能体工具能放大效果,建议在论文中明确标注模型版本。