Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。
#GPT
Andrew Chen发现一个有趣现象:Google和Uber都成了动词,但GPT和Claude还没有。聊聊为什么AI品牌还没渗透到日常用语里。
RubricsTree用4000条真实查询构建100多条可验证规则,评估健康AI比LLM裁判更准,还能当训练奖励,让Gemini等模型性能飙升66%。
设计测评里Claude最强,不用它可以试试Qwen 3.7 Max。还有一套用design.md先出图再生成页面的工作流,挺实用。
这个 CLI 工具让开发者能秒级体验 GPT 功能,适合喜欢命令行操作的 AI 玩家和效率工具爱好者,值得一试。
做AI设计或UI的团队终于有了可落地的避坑指南——用Design.md和图片参考替代直接提示词,效果立竿见影,建议直接收藏这套工作流。
如果你用AI写文章、文案或创意内容,这个现象值得关注——模型在编程上越强,写作可能反而变差,做内容创作的建议点开看看讨论。
这项研究揭示了AI性别偏见在跨语言环境下的复杂性和放大效应,对多语言AI部署团队和公平性研究者来说,是理解偏见机制、设计针对性缓解策略的关键参考。建议关注其四模式框架和跨语言属性重组发现。
做AI编程的开发者会发现Claude和GPT的伦理差异直接影响工作流——Claude会拒绝某些任务,GPT则默默执行,选对工具能避免意外中断或合规风险,值得点开对比。
如果你有 Codex 套餐用不完,现在可以直接驱动 Cola,省下另一份订阅费。做 AI 工具集成的开发者值得关注这个巧妙的资源复用思路。
做学术影响力预测或科研评价的团队,这篇论文直接对比了图模型和LLM两种路线,给出了冷启动场景下的最佳实践——有向引用图+文本嵌入组合最稳,GraphRAG未必比简单提示好。值得点开看具体实验设计和结论。
该研究揭示了LLM在公共政策模拟中的系统性偏差,对AI辅助决策的可靠性提出警醒,值得政策制定者和AI开发者关注。