全部动态
Tw93 把 Mac 上 611 款软件的 AI 自动化实测做成了可查清单,关键发现是无障碍属性能让 AI 定位元素更准,独立开发者很该看看。
Anthropic 的 Boris Cherny 拿 Opus 5.5 写 Lean 验证 Claude Agent SDK,几条提示词修出 16 个 bug,并发代码排查可以抄这个思路。
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
这篇对照实验实测了 Figma Make 到底省不省时间:50 个设计师加 50 个产品经理做同样任务,用的人快 20%,产品经理提升最明显。
这篇讲了怎么把智能体跑长任务的 token 开销砍一半,方法只有一条:压缩只删不改,还开源了能在 Claude Code 里直接用的实现。
浏览器操作智能体的性价比榜刷新了,GPT-6 Sol 比.Opus 便宜三倍还高分,挑模型前可以看看这份数据。
一篇很实在的论文:作者发现长文档检索差的真正元凶是近处无关文字抢注意力,给出 LYRA 方法外加 ProxBench 基准,做了 RAG 的话值得看他们的实验数据。
量化到 2-bit 后模型做数学题会发疯循环?这篇论文用 on-policy 蒸馏把 MATH-500 保留率从 35% 拉到 70%,做端侧部署的可以看看。
标注预算不够又想评估策略?这篇 arXiv 论文告诉你怎么分配人工标注最省钱,RMSE 能降一半以上。
研究 grokking 为什么突然泛化的论文,理论算出 grokking 时间由学习率乘 weight decay 决定,还用上千个网络验证了,做可解释性的可以看看。
数据集成领域的新论文,LOKI 能自动从文本里发现不同表之间的行级关联,精度 0.982,比直接调 LLM 便宜 40 倍,做数据湖的可以看看。
浪潮信息出了台 128 颗国产芯片的超节点,实测能跑 2.8 万亿参数的 Kimi K3,每 token 延迟 5.85 毫秒以内,国产算力堆叠挺猛的。
理想把车端模型拆成大脑、世界模型和视觉语言三块来做,35B 和 4B 边缘版都给了,做具身智能的可以看看架构思路。
中国电信开源了个 29B 的 MoE 模型,只激活 4B 参数、支持 256K 上下文,全程在昇腾芯片上训练,权重挂在 Hugging Face 和 ModelScope 上可以直接下载。
Alibaba的T-Head发了新芯片Zhenwu V900,性能是M890的三倍,还带216GB内存,2027年初量产,做AI训练推理的可以关注下规格。
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。
OpenAI 一口气发了 GPT-6 Sol 和 Luna 两款新模型,API 价格砍半,Sol 在基准测试里能跟 Claude 旗舰打平,性价比党可以直接上手试试。
Anthropic 出了 Claude Opus 5.5,能力对标 Fable 5.1,价格还降了 40%,写代码的用户可以直接换上试试。
低配显卡党福音:Unsloth 把 Qwen-Image-2.1 量化到 12GB 显存就能本地生图,6GB 显存走 FP8 offloading 也能跑,质量还对标 Nano Banana 2.0。
机器人移动操作总因底盘跑偏而失败?这篇论文让策略直接预测地图坐标系下的底盘目标位姿再用定位反馈去跟踪,6 个真实任务成功率全赢速度控制,做具身智能的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档