#GPT-5
共 56 条 · 7 天 3 条 · 30 天 13 条 · 话题观测 →
7月10日
7月9日
7月7日
7月2日
行业22:45
企业AI成本失控,花旗Adobe等限制员工使用大模型企业AI费用爆涨(月花1500万美元)开始限制高级模型,花旗、Adobe、Atlassian都有动作。想知道怎么控制AI成本?看看这些公司的做法。
IT之家原文
6月29日
Nature Medicine论文开源测试套件:GPT-5.5 Pro得分79%
Nature Medicine那篇论文把模型考倒了,但作者直接把考卷开源了。后来GPT-5.5 Pro重新考,分数涨了10%!
6月28日
AI玩《文明VI》23局:Claude核平法国仍输,暴露感知与执行短板
有人让Claude、GPT-5、Gemini玩《文明VI》,结果Claude造核弹炸了法国却还是输了,暴露了AI在复杂决策中根本的感知和执行缺陷,比单纯比分数有意思多了。
IT之家原文
6月25日
6月24日
6月12日
Recursive Agent Harness:递归智能体框架提升长上下文推理
RAH 解决了长上下文推理中智能体扩展性的核心瓶颈,做复杂编码任务或智能体系统的开发者可以直接参考其设计思路,效果提升显著。
6月10日
Fable 5 两小时优化 HVM5 性能提升 1770%,碾压 GPT-5 agent 集群
Fable 5 用 2 小时干赢了 32 个 GPT-5 agent 跑 20 小时,做系统优化或高性能计算的开发者看完会沉默——这不仅是效率碾压,还顺手修了作者都没发现的 bug,值得点开看细节。
6月2日
5月19日
A-ProS:多模型反馈实现可靠自主编程
竞争编程开发者终于有了一个能可靠迭代的 AI 助手——A-ProS 通过多模型反馈将 GPT-5 的初始通过率提升 2 倍以上,做算法竞赛或自动化代码生成的团队可以直接参考其架构设计。
Raven 3.5 专精客服,小模型击败 GPT-5 和 Claude Sonnet
客服团队和语音 AI 开发者可以亲眼看到:小模型专精化路线在延迟和效果上碾压通用大模型,PolyAI 的新工具让 10 分钟部署语音代理成为现实,值得立即关注。
5月13日
LLM 0.32a2 发布:支持 OpenAI 推理模型与 /v1/responses 端点
LLM 用户终于能直观看到 GPT-5 等模型的推理过程了,做 AI 工具链和命令行调用的开发者值得升级体验。