8月23日
17:58
8月22日
12:08
8月14日
23:46
8月13日
17:46
17:46向阳乔木@vista8
博主@vista8 用与DeepSeek V4 Pro相同的提示词测试Grok 4.6。在一个打砖块游戏中,Grok 4.6设计出带熔炉故事场景的情节,音效表现也可圈可点。该模型还一次生成了60种Bento样式风格,其中部分样式的视觉效果优于DeepSeek V4 Pro。
事件专题

推荐理由:有人用同一组提示词跑Grok 4.6和DeepSeek V4 Pro,Grok在打砖块场景和Bento样式上都很惊艳,部分比DS 4 Pro还好看。
17:43
7月29日
01:37
01:37官方账号Perplexity@perplexity_ai
精选
Perplexity AI 在 Computer 应用中上线了 Model Council 功能。用户可对多个前沿模型运行独立分析,并选择分析深度。最终生成一份带引用的综合报告,明确标注各模型一致、分歧之处,以及各自发现的独到内容。该功能旨在帮助用户从多角度获取更全面的分析结果。
推荐理由:Perplexity 在 Computer 里加了个新功能,能同时让好几个 AI 模型分析同一问题,给你一份对比报告,标记哪里一致哪里不同。适合搞调研或写文章时用。
7月23日
11:15
11:15shao__meng@shao__meng
用户对 Gemini 3.6 Flash 进行实测,结果显示其性能与 Gemini 3.5 Flash 接近。Token 消耗确实略低于上一代。同时,Antigravity 负责人宣布平台已接入 Gemini 3.6 Flash,并为所有用户重置了每周配额。该负责人为此举办了类似 Tibo 和 Claude 的 RESET 活动。
事件专题

推荐理由:有人实测了 Gemini 3.6 Flash,发现和上一代差不多但省点 token。Antigravity 也接入了这个模型,还重置了配额,可以看看效果。
7月17日
15:00
7月16日
00:09
7月15日
01:17
7月10日
19:58
11:03
7月8日
14:17
14:17Ethan Mollick@emollick
Sol 和 Fable 这两个新 AI 模型在智能水平上相比之前模型实现了大幅提升。它们与排名其后的最佳 AI 之间产生了显著性能差距。Ethan Mollick 认为,对于任何需要更高智能的任务,Sol 和 Fable 是目前仅有的两个选择。
推荐理由:Mollick 说 Sol 和 Fable 比之前所有模型都强,甚至甩开了其他顶级 AI。做需要高智力的活,目前就选这俩。
13:03
7月5日
23:27
7月2日
09:17
09:17elvis@omarsar0
GLM-5.2、Fugu Ultra、Fable 5 三个模型在同一个 one-shot prompt 下进行了生成效果对比。作者认为最后一个模型 Fable 5 表现最佳。该测试未提供具体基准分数或评测指标。
事件专题

推荐理由:博主 omarsar0 用同一个 prompt 对比了 GLM-5.2、Fugu Ultra、Fable 5,他最喜欢 Fable 5 的生成结果,你可以看看三个模型的差异。
6月23日
20:18
6月12日
04:35
04:35lmarena.ai@lmarena_ai
Agent Arena 发布了完整的智能体排行榜,涵盖多个 AI 模型的智能体能力评测。该排行榜通过自动化测试评估各模型在任务执行、工具调用等方面的表现,为开发者选择智能体模型提供参考。榜单数据公开可查,支持社区持续关注和对比。
推荐理由:做智能体开发的团队可以直接参考这份排行榜选型,省去自己评测的时间,建议点开看看各模型的具体表现。
6月10日
22:20
22:20berryxia@berryxia
一条推文对比了 Fable 5、Opus 4.8、Gemini 3.1 Pro 和 GPT 5.5 四款模型,指出只有 Google 还在使用去年的模型。这反映了当前 AI 模型迭代速度的差异,Google 的 Gemini 3.1 Pro 相对落后于其他厂商的新模型。
事件专题

推荐理由:关注模型迭代节奏的开发者可以快速了解各厂商最新进展,Google 用户会意识到其模型可能落后了。
6月6日
6月2日
10:30
10:30shao__meng@shao__meng
Claude Opus 4.8 在基准测试、诚实度和长任务处理上优于 4.7,但作者认为这种进步对用户来说并不构成真正的改变,只是 4.7 的升级版。对于已经在用 Opus 4.7 的用户,切换到 4.8 是自然的选择,但不会吸引 GPT-5.5 或 DeepSeek 的用户迁移。作者指出,除非 Opus 5 有重大突破,否则难以撼动现有格局。
事件专题

推荐理由:如果你在用 Opus 4.7,升级到 4.8 是顺理成章的事;但如果你是 GPT 或 DeepSeek 用户,这次更新不值得你切换。做模型选型的团队可以看看这篇冷静分析,避免被 Benchmark 数字带偏。