8月13日
17:56
17:55
17:53
17:53官方账号Decoder@Matthias Bastian
xAI 发布 Grok 4.6,在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 持平,仅次于 Claude Opus 5。在智能体任务中,Grok 4.6 完成复杂工作流平均约 53 步,而 Claude Opus 5 需要约 103 步。Grok 4.6 的 API 价格比 OpenAI 最强模型低 60% 以上。
事件专题

推荐理由:xAI 的 Grok 4.6 跑分追平 GPT-5.6,智能体任务比 Claude 更省步数,价格还便宜一大截,想换 API 的可以看看。
17:46
17:46IT之家博客/媒体
DeepSeek V4 Pro 正式版于8月13日晚间发布,已更新至API,调用模型名保持不变。新版本增强了Agent能力,支持Responses API和Codex接入。官方评测显示,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。
事件专题

推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。
8月12日
20:49
20:49官方账号Decoder@Jonathan Kemper
Nvidia正在开发开源权重模型Nemotron 4,目标参数规模达一万亿,旨在与全球最佳免费模型竞争。然而,中国实验室如DeepSeek和Qwen已在更大规模上取得进展。Nemotron 4的发布将加剧开源模型领域的竞争。
事件专题

推荐理由:Nvidia要出万亿参数开源模型了,但中国实验室已经跑在前面,看看这场竞赛怎么打。
18:28
18:28官方账号Decoder@Matthias Bastian
精选
微软发布MAI Code 1.1 Flash,用于GitHub Copilot,声称比前代节省25%的token,成本降低75%。但在基准测试中,其性能被更便宜的DeepSeek V4 Flash超越。此举符合微软一贯模式:宣传开源AI,却在应用中内置更差的专有模型以保护利润。

推荐理由:微软新代码模型被DeepSeek碾压,价格性能都输,想了解Copilot背后模型真实水平的朋友可以看看。
01:11
00:31
00:31techcrunch@Russell Brandom
83°
Anthropic的一个未发布模型在数学领域最著名的未解问题之一——黎曼猜想上取得了进展。该模型在相关基准测试中表现优于现有模型,尽管未能完全解决猜想,但展示了AI在数学推理方面的潜力。这一成果可能对数学研究产生深远影响。
事件专题

推荐理由:Anthropic的新模型在黎曼猜想上取得了进展,虽然没完全解决,但比预期强,值得看看AI在数学上能走多远。
00:26
00:26官方一手AWS Machine Learning Blog@Koyo Hidaka
精选
ONESTRUCTION在AWS Generative AI Innovation Center的技术支持下,构建了专为建筑和BIM工作流设计的基础模型Ishigaki-IDS。该模型通过合成数据、三阶段训练流程和可验证奖励机制,在Amazon EC2上完成训练。案例展示了在数据稀缺领域如何利用AWS工具链构建领域专用模型。
推荐理由:建筑行业缺数据?看ONESTRUCTION怎么用AWS的合成数据和三阶段训练搞出个专用模型,挺有参考价值。
8月11日
23:34
23:34官方账号Decoder@Matthias Bastian
精选
Nvidia发布开源权重模型Nemotron 3.5 Lightning,仅36亿活跃参数,在智能指数上与OpenAI的gpt-oss-120b持平,但体积小四倍。该模型每秒处理近670个token,是对比中速度最快的模型。Nvidia此举表明其更注重效率而非模型规模。
事件专题

推荐理由:Nvidia新出的开源模型,36亿参数跑得比1200亿的还快,速度拉满,适合追求低延迟的开发者。
14:49
10:34
02:46
02:46官方账号Decoder@Matthias Bastian
精选
Hugging Face与EleutherAI的FineBooks项目测试了14款开源OCR模型,覆盖2000多页历史书籍。表现最好的dots.mocr字符准确率达97.6%,处理每千页成本低于2美元。团队认为该精度已可用于AI训练数据,但尚未达到学术转录标准。

推荐理由:Hugging Face和EleutherAI测了14款开源OCR,dots.mocr最准,97.6%准确率,每千页不到2美元,处理旧书够用了。