全部动态
TTLab 团队用 MARBERTv2 检测阿拉伯语机翻的错误片段,加了焦点损失和方言阈值,六款编码器里效果最好,在赛事拿了第三名。
给做代码智能体的朋友:这个新基准不测修 bug,测的是治理仓库,10 个模型里 Kimi-K3 在完整对比里表现最好,评分方法也挺有意思。
一篇很实用的数据筛选流水线:40718 帧 maritime 视频只挑 220 张标注,微调 YOLO26-m 就能到 AP50 94.78%,标注成本省了 99.5%。
大家都盯着实验室刷数学证明,这条讲历史学家怎么用 AI 破 John Dee 密码、挖 Darwin 的思想源头,角度少见。
Google DeepMind 这篇论文挺扎心的:你给智能体一句自信但错误的建议,它会照做还不吭声,三大主流模型最多掉分 46.7%。
Stanford 和 Together AI 的新论文,智能体别再投票吵架,学15道题分工互检,3个模型从48.8%干到66.7%。
《npj Digital Medicine》这篇新文讲怎么用隐私增强技术让健康 AI 更公平,做医疗 AI 的人可以看看。
Apple 发了一篇联邦学习论文,讲怎么用伪标签在无标注数据上训 ASR 模型,还给了稳定训练的实操配方,做语音方向的可以看看。
Boltzbit 给出了智能体自我改进的第二条路:直接改权重而不是堆记忆,理论上算力省约 1000 倍,思路很值得琢磨。
Ethan Mollick 说那张刷屏的 METR 任务时长曲线该退休了,还给出了替代图,做 AI 汇报的人可以看看。
Meta 给智能体配了个记忆员,专记它犯过的错并适时提醒,把 Claude Sonnet 4.5 成绩从 37.6% 拉到 45.9%,做智能体的可以看看。
Anthropic 让 950 个 Claude 智能体只花 21 小时就找到类似 CRISPR 的基因剪辑新系统 ART,看看 AI 怎么做科研的。
Fireworks 的特种智能指数又添新成员,这次是 FactoryAI 的 Legacy-Bench,专门考模型能不能搞定遗留代码系统,做企业级 Agent 的可以关注。
Google 这篇论文拆了 serverless CPU 跑量化小模型的延迟构成,55-70% 耗在加载权重,加内存到 8 GB 就能让推理快近一倍,部署前值得看。
这篇论文做了实验:Agent 记忆里存错一条权限,98.6% 的情况下会照着执行,修正记忆后归零。做 Agent 权限系统的建议看看。
恶意skill会装的时候装乖,用的时候才下手,这篇论文的SkillSonar在GLM-5上把攻击成功率砍到10%左右,讲清了怎么防。
Epoch AI 搞了个叫 FAB 的新基准,让模型看宜家说明书加半成品照片找拼装错误,10 个月内最高分从 28% 冲到 80%。
METR 给 Anthropic 的 AI 研发加速打了个具体分数:1.5 倍。想知道 AI 到底多大程度替代了工程师干活,这个口径很严谨,值得看看。
Salesforce 这篇论文发现公开 RL 环境大多有奖励错误,还给出 RIVER 筛选方法,8B 模型跑分反超随机采样,做 RL 训练的都该看看。
NVIDIA 把公开 Agent Skills 自动转成 RL 训练环境,产出近 8000 条任务,还开源了流水线思路,做 Agent 训练的可以看看。
Google 这篇论文把 agent harness 蒸馏进模型,移除专用 harness 后成功率反而从 23.3% 涨到 44.3%,比带 harness 还高,做 agent 的都该看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档