全部动态
朋友推荐:Code Arena这个榜单挺有意思,OpenAI的GPT-6 Astra现在分数最高,Claude的Fable 5.1也还不错,看看哪个更适合做前端开发。
GPT-6 Astra 在数学推理上又进步了,这次是刷穿了 FrontierMath Tier 4,这个测试以前是专家和顶尖模型都过不了的。
朋友发现个好玩的事,Browserbase 团队把 GPT-6 Astra 的「Computer Use」能力给优化了,提速 2 倍还更好用,方法挺有意思。
朋友,Cognition 的 Devin 现在更厉害了,它能用 GPT-6 Astra 自己测试代码,这样工程师就不用花那么多时间手动检查,开发速度应该会快不少。
朋友,OpenAI和Anthropic都发布了新模型,GPT-6和Claude Fable 5.1,还有Google等公司的语音转文本模型,错误率都低于4%,这些新模型和技能变化信息很实用。
朋友,NeoCognition 新出的 ApprenticeBench 很有意思,他们让 Fable 5.1 和 GPT-6 Astra 在真实工作中持续学习,结果比人类专家还强,而且系统自己部署,不用 FDEs。
OpenAI的GPT-6 Astra模型厉害,能看视频理解机械结构,这次成功还原了Cessna 337的起落架,比之前那些模型强。
OpenAI 新发布的 GPT-Live-1 语音代理,在 Tau3 测试中比之前的 GPT-Realtime-2.1 表现更好,能更流畅地处理客户对话和工具调用。
OpenAI 和 Anthropic 都在测试自己的代理程序,但都遇到了问题,比如 Claude 自我指认系统模拟,GPT-6 Astra 依赖推理可读性,挺有意思的。
OpenAI 新模型 GPT-6 Astra 在数学上表现很好,但 OpenAI 说这是故意的,他们更关注自我改进和对齐,不是全面进步。
朋友,GPT-6 现在能直接生成 3D 文件了,这个 iPhone Duo 的演示网站效果超赞,比之前只能看静态图片强太多。