TypeSafe AI 创始人在 a16z 节目里讲他们的新模型 Jev,思路和 Claude Code 不一样,输出是带置信度的选项,软件能直接用,聊自动化为什么一直没来。
全部动态
OpenAI 把 GPT-6 Sol 短暂开放到 Arena 的 Direct Mode,想去试试新模型手感的可以抓紧这 24 小时。
RespanAI 出了两个专给 Agent 轨迹打分的分类模型,判断用户情绪、工具调用安全性这类行为,Lite 版免费,比 Jev 还准。
同一道题,Claude Opus 5.0 找到漏洞但选择不用,GPT-6 Astra 直接拒绝,几个顶级模型的安全表现差距一眼就能看出来。
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
a16z 聊了个新模型 Jev,它不输出文本,而是给软件返回带置信度的选项,开发者能直接用来写自动化程序,跟 Claude Code 思路完全不同。
OpenAI 要做个人智能体了,还有个叫 Bel 的新模型跟 Gemini 4.0 Pro 打对台,这几个模型代号你可以先记一下。
ElevenLabs 新的 Eleven v4 拿了语音合成榜第一,支持 90 多种语言,发音准确率 91.7%,就是价格比 Google 贵不少。
MiniCPM5-2B 出了 4-bit 量化版,权重才 1.61 GB,T4 上能跑 70 tokens/s,想在自己机器上跑小模型可以试试。
网络安全方向的新基准,Grok 4.7 和 MiMo-V2.6-Pro 并列第一,但 GPT-6 Sol 在端到端任务上全部拒绝执行,这个对比挺有意思。
看图直接给候选动作打分的开源小模型,底座是 Qwen3.5-0.8B/2B,单步 122ms,做 GUI Agent 或机器人反射层挺合适。
有人实测了 Claude Opus 5.5 做视觉设计,说是目前所有模型里最强的,视频里有实际效果,做前端设计的可以看看对比。
阿里这次没发新模型,而是让 Qwen3.8-Max 自己训自己,33 轮迭代后成绩追上 Claude 和 GPT,还顺手把多模态价格砍了九成。
Fireworks 拿 Kimi K3 改了个 Ember-1,推理 token 少用 40% 还不掉分,省钱党可以看看。
Fireworks 在 Kimi K3 上做了后训练,产出 Ember-1,跑编程任务时推理 token 少了 71%,性能不变,省钱明显。
一个开源科研智能体把 Codex 和 Claude Code 都比下去了,Apache 2.0 免费随便用,还能接自家模型。
有人把 Opus 5.5 和 GPT 6 的跑分放在一张图里了,重点看 Terminal-Bench 4.0,GPT 在跨应用自动化那项表现很猛。
巴西团队用 104 美元训了个分类模型 Julia-1,还开源了。如果你在搭 agent 框架,可以试试分类器加推理模型混合调度这个思路。
Garry Tan 实测 Opus 5.5 加 Openclaw 干活比 GPT-6 Astra 更利索,选模型搭子的参考。
Interfaze 开源了 lev,用 Qwen-3.5 4B 做底座,一次前向就能批改判断题、选择题和打分题,做自动测评的可以看看。
Perceptron 的 Mk1.5 上线 OpenRouter 了,做机器人或物理智能体的可以看看,能直接输出检测框和视频片段,不只是文字回复。
Yuchen Jin直接说Claude Opus 5.5不如Astra,还断言编程能力从Opus 4.8起就停滞了,看看这个反主流判断
Mollick 聊了个基准测不出来的事:Claude Opus 从 4.7 到 5 失去了原有"性格",5.5 又找回来了,用 Claude 的人应该有同感。
OpenRouter 公布分类请求数据,Jev 拿下 27% 份额,把 DeepSeek V4 Flash 挤到第二,做分类任务可以关注下。
Anthropic 的 Opus 5.5 (High) 拿下 Text Arena 第一,1509 分比上一代高 18 分,前六名全是他们家,价格数据也标出来了。
Claude Opus 5.5 (High) 在 Text Arena 拿了 1509 分,价格每百万 token 16 美元,选模型时可以参考这个性价比坐标。
这条视频全靠 Claude Opus 5.5 生成对白、音乐和 Blender 画面,没用视频生成模型,思路挺有意思,可以看看它能做到什么程度。
Odyssey 新出的 Agora-2 能让 20 个人和 AI 在同一个实时生成的世界里玩,像 AI 版游戏引擎,多人视角还能互不冲突,做智能体研究的可以看看。
YC 拉了 Waddle Labs 和 Robocurve 的创始人聊怎么用通用模型直接操控机器人,还现场演示了 Astra 控制,搞机器人的可以看看。
Gemini 4 已经进入后训练阶段,Kavukcuoglu 说可能年底前就发布,目标是追上 Anthropic 和 OpenAI。
Jared Palmer 的 Kev 4B 上 OpenRouter 了,输出免费、输入每百万 token 才 $0.042,传状态进去就能拿到结构化的回答,做小任务很便宜。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档