华为团队把 44 万个 GitHub 仓库和 55 万篇 arXiv 论文连起来,发现星标等信号能提前判断哪篇论文会火,精度提升 12%,数据集免费下载。
全部动态
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
做 AI 产品的话这篇挺实用:Ramp、Shopify、Cursor 这些公司靠写 evals 把指标提了多少,还附了个免费插件让编码 Agent 帮你干活。
宝玉用同一份超详细提示词,让 Opus 5.5 和 GPT 6 Astra 各做一个能逛的 3D 樱花山谷网页,截图摆一起看差距。提示词本身就值得抄走。
韶音把 Qwen 塞进了开放式耳机,双击就能问天气、记待办、总结会议,还能翻译,1398 元已经能买了。
Simon Willison 把 Claude Opus 5.5 和 GPT-6 两个版本放在同一套画鹈鹕测试里对比,想快速了解三者差别看这篇就够了。
Palo Alto Networks 出了个 AI 网络防御服务,可以混搭 OpenAI、Anthropic 或开源模型,按你选的模型组合来计费,做安全的可以看看。
一篇新论文 CompKV,重新设计了稀疏注意力里的 token 选择逻辑,长上下文推理自注意力最高快 6.85 倍,做推理优化的可以看看。
一篇很实用的论文:不改模型、不改提示词,只在运行时注入失败 informed 的策略指令,GPT-5.6 跑 Terminal-Bench 的重复成功率就能涨近 10 个点,做 Agent 的可以看看。
一个做 3D 点云生成的新扩散架构 EMERGE,用图神经网络替代常规网格化管线,一次训练就能在任意分辨率零样本出结果,做 3D 生成的话可以看看这篇。
一篇体系结构论文,做了个跨主机的总线互连,64 卡系统上把 RoCE 的延迟砍一半,跑 DeepSeek R1 快 30%-80%,做 AI 集群的你看看。
拿 Gemma、Llama、DeepSeek 三个模型做了个挺狠的测试:简单题模型根本不看自己的推理,难题上错误会一路传到底,这对做 CoT 监控的人是个警告。
拿 2267 份真实英国基金申请,让 Gemma 3 27B 和 DeepSeek R1 等六个开源模型打分,跟人类审稿人比相关系数,结论是初筛能用、终审不行。
这篇论文挺反常识的:不用任何权重、靠 Mandelbrot 分形坐标做语言决策,延迟只有 7ms 还能跑在单片机上,可以看看它怎么绕开 LLM 的。
一篇教 RL 生成 SVG 的论文:把每条指令拆成 6 项评分细则当奖励,不需要标注数据,效果追平 DeepSeek-V3,做生成任务奖励设计的可以看看。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
GP-6 Sol 价格砍半,OPPO Find X10 也只要 4999 起,还有 iQOO 16 和荣耀 Magic9 的新机信息,一条看完全部。
Qualcomm 新旗舰芯片来了,2nm 制程加 5GHz 主频的手机 CPU 还是头一回,主打端侧跑智能体,关注手机性能的可以看看。
OpenAI 把 GPT-6 打到五折,阿里自家 AI 芯片算力翻了三倍,还有高通 2nm 新旗舰芯片,一天大事全在这。
古尔曼最新爆料,苹果在做整合 iOS、tvOS、watchOS 特性的 homeOS,设备带屏还能人脸识别,Siri AI 是核心交互,智能家居要变天了。
GPT 6 Sol 和 Luna 直接砍半价,Benchmark 上比 Opus 5 便宜 10 倍,同天 Claude 也降价了,这波价格战值得看看对比数据。
Simon Willison 的命令行工具 llm 更新了,这次能直接调用 OpenAI 的 GPT-6 Sol 和 Luna,单轮模型也有专门的处理机制。
Anthropic 和 OpenAI 前后脚发新模型还互相砍价,GPT-6 Luna 只要 $0.10/M,做应用的成本又降一半,附完整价格对比表。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档