#LLM
共 791 条 · 7 天 46 条 · 30 天 185 条
6月25日
LatentMAS 被 ICML 2026 接收为 Spotlight,多智能体在潜在空间协作
ICML 2026 spotlight!这帮人让多智能体在潜在空间用思想沟通,不用说话,比传统文本交互快4倍,准确率还高14.6%。
Loop Engineering 反思:循环放大 LLM 代码缺陷与认知依赖
Mitsuhiko 深入剖析了 Loop Engineering 的两层循环,指出循环会放大 LLM 代码的缺陷,并讨论了我们可能失去判断力的风险。对 AI 编程陷阱感兴趣的朋友值得一看。
6月24日
OpenAI发布首款自研AI芯片Jalapeño,与Broadcom合作生产
OpenAI自己造芯片了,名字叫Jalapeño,专跑ChatGPT和Codex那类LLM任务,还拉上Broadcom合作量产。
论文12:08
多轮LLM对话中NFR评估的准确性与满意度这篇论文用49个程序员和148个实例,实测了GitHub Copilot评估HIPAA合规NFR的准确度,发现开发者容易被带偏,但主动交互反而让人更满意。
模型00:57
PlanBench-XL:在大型工具生态中评估LLM智能体的长程规划想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。
6月23日
论文12:50
Causal Discovery in the Era of Agents: 论文提出代理应辅助而非替代因果推断这篇论文给了一个清晰的边界:AI代理该帮什么、不该帮什么。causal-learn+平台演示了如何让LLM辅助分析数据,但不越界做因果推断。
论文11:08
Text2DSL: LLM-Based生成领域特定语言代码的新任务与PolkitBench数据集这篇论文定义了Text2DSL任务,带了一个4204条规则的数据集PolkitBench,还发现喂给模型语法规则能让代码生成质量暴增,不用微调。
6月21日
6月20日
行业07:26
Gary Marcus批LLM公司夸大AI取代工作,预测2025年少于10%岗位被替代Gary Marcus戳破LLM公司的裁员恐慌话术,还甩出了具体预测数据。告诉你别被炒作了,AI也在创造新岗位。
6月19日
论文11:04
利用眼动与鼠标轨迹获取用户隐式偏好:IFLLM数据集提升LLM对齐效果别光看用户点了什么赞,鼠标和眼睛动的方向才是真心话。这篇论文用59人的眼动和鼠标轨迹数据训练奖励模型,准确率从55%飙到64,还开源了数据集。
论文10:08
ScholarQuest:面向开放文献的学术论文搜索智能体基准想测你的LLM论文搜索智能体?ScholarQuest 给了1000多个主题和4种意图的标准测试,最强方法才0.314召回,你的能提多少?
6月18日