TypeSafe AI 创始人在 a16z 节目里讲他们的新模型 Jev,思路和 Claude Code 不一样,输出是带置信度的选项,软件能直接用,聊自动化为什么一直没来。
全部动态
OpenAI 把 GPT-6 Sol 短暂开放到 Arena 的 Direct Mode,想去试试新模型手感的可以抓紧这 24 小时。
RespanAI 出了两个专给 Agent 轨迹打分的分类模型,判断用户情绪、工具调用安全性这类行为,Lite 版免费,比 Jev 还准。
同一道题,Claude Opus 5.0 找到漏洞但选择不用,GPT-6 Astra 直接拒绝,几个顶级模型的安全表现差距一眼就能看出来。
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
a16z 聊了个新模型 Jev,它不输出文本,而是给软件返回带置信度的选项,开发者能直接用来写自动化程序,跟 Claude Code 思路完全不同。
OpenAI 要做个人智能体了,还有个叫 Bel 的新模型跟 Gemini 4.0 Pro 打对台,这几个模型代号你可以先记一下。
ElevenLabs 新的 Eleven v4 拿了语音合成榜第一,支持 90 多种语言,发音准确率 91.7%,就是价格比 Google 贵不少。
月之暗面的 Kimi K3.1 被开发者从 API 后台挖出来了,100 万上下文加三档推理强度,定价可能和 K3 持平。
MiniCPM5-2B 出了 4-bit 量化版,权重才 1.61 GB,T4 上能跑 70 tokens/s,想在自己机器上跑小模型可以试试。
网络安全方向的新基准,Grok 4.7 和 MiMo-V2.6-Pro 并列第一,但 GPT-6 Sol 在端到端任务上全部拒绝执行,这个对比挺有意思。
看图直接给候选动作打分的开源小模型,底座是 Qwen3.5-0.8B/2B,单步 122ms,做 GUI Agent 或机器人反射层挺合适。
华为把 openPangu-2.0 从预训练到 RL 的训练代码全开源了,配昇腾 MoE 栈,之前 Pro 505B 和 Flash 92B 权重也能配上完整流程。
有人实测了 Claude Opus 5.5 做视觉设计,说是目前所有模型里最强的,视频里有实际效果,做前端设计的可以看看对比。
StepFun 这个 Step 5 Preview 有 1M 上下文,主打长程智能体任务,权重月底开源,可以等开源后自己跑一跑。
NaiveAI 放出了 MIT 协议的 309B MoE 开源模型,激活参数只有 15.5B,还能吃下 1M 上下文,做长代码分析可以试试自己部署。
美团把 LongCat 升到 2.5 预览版,1M token 上下文加多模态,专门给跑长任务的编程智能体用,不过这次没放跑分数据。
阿里这次没发新模型,而是让 Qwen3.8-Max 自己训自己,33 轮迭代后成绩追上 Claude 和 GPT,还顺手把多模态价格砍了九成。
Anthropic 下一款 Sonnet 5.5 被内测网友扒出来了,实测编码干过 GPT-6 Sol,价格只要 $2/百万 token,文章还教你怎么检查自己有没有被灰度到。
Fireworks 拿 Kimi K3 改了个 Ember-1,推理 token 少用 40% 还不掉分,省钱党可以看看。
Fireworks 在 Kimi K3 上做了后训练,产出 Ember-1,跑编程任务时推理 token 少了 71%,性能不变,省钱明显。
一个开源科研智能体把 Codex 和 Claude Code 都比下去了,Apache 2.0 免费随便用,还能接自家模型。
有人把 Opus 5.5 和 GPT 6 的跑分放在一张图里了,重点看 Terminal-Bench 4.0,GPT 在跨应用自动化那项表现很猛。
巴西团队用 104 美元训了个分类模型 Julia-1,还开源了。如果你在搭 agent 框架,可以试试分类器加推理模型混合调度这个思路。
Garry Tan 实测 Opus 5.5 加 Openclaw 干活比 GPT-6 Astra 更利索,选模型搭子的参考。
Interfaze 开源了 lev,用 Qwen-3.5 4B 做底座,一次前向就能批改判断题、选择题和打分题,做自动测评的可以看看。
Perceptron 的 Mk1.5 上线 OpenRouter 了,做机器人或物理智能体的可以看看,能直接输出检测框和视频片段,不只是文字回复。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档