Yuchen Jin直接说Claude Opus 5.5不如Astra,还断言编程能力从Opus 4.8起就停滞了,看看这个反主流判断
全部动态
Mollick 聊了个基准测不出来的事:Claude Opus 从 4.7 到 5 失去了原有"性格",5.5 又找回来了,用 Claude 的人应该有同感。
OpenRouter 公布分类请求数据,Jev 拿下 27% 份额,把 DeepSeek V4 Flash 挤到第二,做分类任务可以关注下。
Anthropic 的 Opus 5.5 (High) 拿下 Text Arena 第一,1509 分比上一代高 18 分,前六名全是他们家,价格数据也标出来了。
Claude Opus 5.5 (High) 在 Text Arena 拿了 1509 分,价格每百万 token 16 美元,选模型时可以参考这个性价比坐标。
这条视频全靠 Claude Opus 5.5 生成对白、音乐和 Blender 画面,没用视频生成模型,思路挺有意思,可以看看它能做到什么程度。
Odyssey 新出的 Agora-2 能让 20 个人和 AI 在同一个实时生成的世界里玩,像 AI 版游戏引擎,多人视角还能互不冲突,做智能体研究的可以看看。
一句提示词、100 美元算力,Claude 花几天算出物理学家们卡了两年的九圈振幅,老纪录保持者 Lance Dixon 亲自验算确认没问题,过程细节挺精彩。
YC 拉了 Waddle Labs 和 Robocurve 的创始人聊怎么用通用模型直接操控机器人,还现场演示了 Astra 控制,搞机器人的可以看看。
Gemini 4 已经进入后训练阶段,Kavukcuoglu 说可能年底前就发布,目标是追上 Anthropic 和 OpenAI。
有人花 5 欧元租 GPU,让无审查版 Qwen 三十分钟改一个字节就破解了 IDM,这帖子把 AI 逆向能力聊得很具体。
Jared Palmer 的 Kev 4B 上 OpenRouter 了,输出免费、输入每百万 token 才 $0.042,传状态进去就能拿到结构化的回答,做小任务很便宜。
Epoch AI 搞了个新基准,让 AI 看照片对照说明书找宜家家具装错的地方,GPT-6 Astra 拿了 80 分,还顺带测出了各家模型的不同毛病。
一个 FSD 级团队出来做 Physical AI,首版模型 Simate-beta 连同 RoboDojo 一起放出来了,搞具身的可以看看。
OpenAI 的 GPT-6 Astra 看一眼照片就能指出你 IKEA 柜子哪步装错了,准确率 80%,比半年前的 28% 高出不少。
vLLM那帮人创业后干的活:把Kimi K2塞进谷歌TPU,速度比英伟达GPU还快57%,框架还是DeepSeek开源的,搞推理的可以看看细节。
美团放了个 1.6 万亿参数的 MoE 模型,能看图、写代码,还直接兼容 Claude Code,长文档党可以试试。
GPT-6 Astra 打 Minecraft 打出了史无前例的进度,结果一只苦力怕把箱子连人一起炸了,看它气到自我复盘还挺有意思。
GPT-6 Astra 打 Minecraft 打到收集烈焰棒和末影珍珠这一步,比之前所有 AI 都远,结果被一只苦力怕清空存档,直播全程挺有意思。
Convai Innovations 在 Hugging Face 挂出了模型卡,想追开源新模型的话可以直接去页面看参数和用法。
Jev 发布才 7 天,开源多语言 System 1 决策模型就冲上 Hugging Face 趋势榜第一,GitHub 星标破 1.5 万,追开源动态的可以看看。
Claude 只用一条提示词就跑出了物理学家之前不敢碰的九圈计算,Dixon 本人验证通过,成本才几千美元,做物理的可以看看细节。
HuggingFace 开源了 5000 个数据科学 RL 任务,源自真实 Kaggle 笔记本,评分不用 LLM 判卷,还配了 SFT 轨迹和 Colab 脚本,想自己练小模型可以直接上手。
Recraft 的 V4.1 Flash 速度真快,用户 Heather Green 放了四组油画和复古字排的完整提示词,想玩文生图的直接抄。
Anthropic 的 Claude Opus 5.5 把破折号用量砍了 95%,回答还变长了 6%,全靠更短的句子撑起篇幅,数据挺有意思。
Hugging Face 开源了 5000 个可验证 RL 任务,专练小模型的代码和数据科学能力,环境和训练脚本全给你,想自己跑 RL 的可以看看。
Text Arena 拆了 Opus 5.5 和 5 的写作差异:句子短了 17%,破折号少 95%,但含糊词翻倍,写东西前可以看看。
Perceptron 新出的 Mk1.5 专门给无人机、机器狗这类设备当大脑,能持续追踪视频里的物体、听懂声音,还会自己派子代理干活,价格也挺便宜。
Anthropic 官方盘点了 Opus 5.5 的玩法,有人一句话花 25.66 美元做了个可交互的镜头对焦模拟器,成品能直接玩。
OpenRouter 跑了五个 agent 基准,Jev Router 首 token 延迟全场最快,做智能体的可以看看选路由了。
Qwen Image 3 Pro 在 OpenRouter 社区票选里赢过了 Nano Banana Pro 和 GPT Image 2,想换图像模型可以看看这份排名。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档