7月3日
09:04
09:04官方账号arXiv cs.LG@Samiha A. Ismail, Fan X. Chen, Ali Merali
研究者设计了5个临床场景(麻醉、内科/家庭医学、急诊、产科),共184条MECE评分标准。GPT 5.4、Claude Opus 4.7、Gemini 3.1 Pro的平均rubric通过率分别为0.39、0.47、0.37。最关键的权重5标准通过率仅32.4-41.7%,而低权重(1)标准通过率80-90%。108个关键标准中52%未被任何模型满足。LLM自动评分器在92.8-94.7%的标注上再现专家判断。
推荐理由:这篇论文告诉你当前最强模型在临床推理上有多弱:关键问题正确率不到一半,而简单问题却能答得很准。适合想了解模型真实局限的读者。
6月26日
00:27
00:27官方账号Decoder@Matthias Bastian
《华盛顿邮报》的一项调查发现,多数主流AI聊天机器人在政治问题上存在左倾倾向。OpenAI的GPT-5.5在80%的情况下只提供左倾论点。马斯克旗下标榜'反觉醒'的Grok模型也更多偏向左倾。唯一的例外是谷歌Gemini 3.1 Pro,它在93%的测试中呈现了双方观点。
事件专题

推荐理由:想知道你用的AI聊天机器人有没有政治立场?《华盛顿邮报》测了GPT-5.5、Grok和Gemini 3.1 Pro,结果左倾现象普遍,连Grok都没逃过。来看看数据。
6月13日
6月10日
22:20
22:20berryxia@berryxia
一条推文对比了 Fable 5、Opus 4.8、Gemini 3.1 Pro 和 GPT 5.5 四款模型,指出只有 Google 还在使用去年的模型。这反映了当前 AI 模型迭代速度的差异,Google 的 Gemini 3.1 Pro 相对落后于其他厂商的新模型。
事件专题

推荐理由:关注模型迭代节奏的开发者可以快速了解各厂商最新进展,Google 用户会意识到其模型可能落后了。
6月5日
02:16
02:16宝玉@dotey
博主建议用户根据自身条件选择2-3个最聪明的AI模型使用,而非追求数量。他认为单一模型不够稳定和全面,例如GPT-5.5不如Opus 4.8稳定,写作时甚至需要退回Opus 4.6。翻译任务他偏好Gemini 3.1 Pro,画图则选GPT Image 2。即使Opus 4.8表现不错,复杂任务也会让GPT-5.5同时出方案对比。他强调Token贵的省时间,时间比Token更宝贵。
事件专题

推荐理由:这条建议直击AI用户选模型的痛点——不是越多越好,而是选对2-3个最聪明的。经常用AI做复杂任务的开发者或创作者,看完会重新思考自己的模型组合,省下时间比省Token更划算。
5月29日
05:36
05:36官方账号Decoder@Matthias Bastian
88°
Anthropic 推出了 Claude Opus 4.8,该模型在大多数基准测试中超越了 GPT-5.5 和 Gemini 3.1 Pro。相比前代,它发现自身编码错误的频率提高了四倍。同时,Anthropic 还推出了动态工作流功能,可启动数百个并行子智能体来处理代码库迁移等任务。这标志着 Claude 在性能和自动化能力上的显著提升。
事件专题

推荐理由:Claude Opus 4.8 在编码错误检测和并行任务处理上大幅进化,做大型代码库迁移或复杂自动化的开发者可以直接体验动态工作流带来的效率提升。