论文Agent 与开发者精选09:47量化大模型中的激活转向研究这篇论文揭示了量化大模型中激活转向技术的真实表现,特别是推理长度任务中的不对称现象值得开发者关注。#量化#激活转向#LLM#INT8aarXiv cs.LG@Saurav Bhandari, Benjamin Wade原文稍后读已读值得跟进有用关注 量化
模型Agent 与开发者07:52Cohere推出融合LLM解码步骤的MegakernelCohere把LLM解码步骤合并成一个内核,大幅提升GPU效率,代码已开源。#Cohere#Megakernel#LLM#GPU官方账号Cohere@cohere原文稍后读已读值得跟进有用关注 Cohere
论文Agent 与开发者07:12通过离散扩散实现LLM无损加速这篇论文介绍了一种能加速LLM又不损失质量的新方法,速度提升2-3倍,对实际应用很有价值。#离散扩散#LLM#推理加速#开源模型AK@_akhaliq原文稍后读已读值得跟进有用关注 离散扩散
产品Agent 与开发者78°03:58Cohere发布首个基于解码内核的LLM服务系统Cohere开源了比vLLM快1.58倍的LLM服务系统,专为North Mini Code设计。#Cohere#LLM#vLLM#开源模型官方账号Cohere@cohere原文稍后读已读值得跟进有用关注 Cohere
论文17:13LLM分类临床自杀意念研究这篇研究展示了LLM如何分析临床自杀意念数据,对心理健康AI应用有重要参考价值。#LLM#自杀意念#临床评估#可解释性npj Digital Medicine@Tim M. H. Li原文稍后读已读值得跟进有用关注 LLM
技巧Agent 与开发者12:04AI代理可私下协商转让预订你的AI代理能私下找别人代理协商转让预订,就像《黑镜》里那样#智能体#LLM#预订系统Justine Moore@venturetwins原文稍后读已读值得跟进有用关注 智能体
行业中美对照22:45Marcus批评黄仁勋LLM扩展观点Marcus作为AI元老批评黄仁勋观点,了解LLM发展历史的人值得关注。#Gary Marcus#LLM#黄仁勋#AI历史Gary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 Gary Marcus
论文Agent 与开发者11:37LLM解释评估研究:必要性与充分性分析这项研究揭示了LLM解释与实际决策行为之间的差距,对AI系统监控和错误诊断有重要参考价值。#LLM#Claude#GPT#GeminiaarXiv cs.AI@Urja Pawar 等 7 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者精选73°11:36蒸馏全局知识,适应本地需求:可扩展升级推荐框架这个框架让LLM推理能力提升5000倍速度、降低10000倍成本,专为大规模产品升级推荐设计。#LLM#推理蒸馏#测试时训练#推荐系统aarXiv cs.LG@Siliang Liu 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者11:35大模型在分子属性基准中存在数字记忆现象最新研究揭示大模型在分子属性预测中存在数字记忆现象,影响模型评估准确性。#LLM#分子属性#基准测试#verbatim检索aarXiv cs.AI@Matthias Busch 等 7 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者精选73°11:33LLM反编译器重编译保真度研究这篇论文揭示了LLM反编译器的一个关键缺陷:通过测试但行为不一致,可能导致安全漏洞消失。#LLM#反编译#安全#漏洞检测aarXiv cs.AI@Chang Liu 等 3 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者11:31BUGSTONE-E2E:将漏洞历史转化为可执行检测规则研究人员用CVE历史构建了BUGSTONE-E2E,能自动检测软件漏洞并生成修复补丁,比传统方法更高效精准。#BUGSTONE-E2E#CVE#软件漏洞#LLMaarXiv cs.AI@Qiushi Wu 等 7 人原文稍后读已读值得跟进有用关注 BUGSTONE-E2E
论文Agent 与开发者09:40LLM在暖通空调系统应用的综述研究这篇综述分析了66篇LLM在HVAC应用的论文,告诉你哪些场景已可用,哪些仍处研究阶段。#LLM#HVAC#建筑能源#暖通空调aarXiv cs.AI@Alexander Neubauer 等 7 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者09:39基于参考的自动评估方法行为正确性研究这篇论文提出了评估AI文本生成系统的新框架,揭示了传统评估方法无法捕捉的行为差异。#自动评估#LLM#自然语言生成#评估方法aarXiv cs.AI@Maria Mahbub 等 5 人原文稍后读已读值得跟进有用关注 自动评估
论文Agent 与开发者精选73°09:36大模型数学推理缺乏人类知识结构这篇论文揭示了大模型在数学推理中缺乏人类知识结构,对理解大模型认知局限很有价值。#LLM#数学推理#知识空间理论#大模型评估aarXiv cs.AI@Peng Cui 等 3 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者精选09:21CABAL:多智能体模拟合谋评审影响AAAI-27评审周期发现合谋风险,CABAL框架首次完整模拟合谋评审全过程,揭示其影响机制。#CABAL#多智能体#合谋评审#LLMaarXiv cs.AI@Jicheng Zhou 等 8 人原文稍后读已读值得跟进有用关注 CABAL
论文78°07:2221名顶尖学者:LLM是通往AGI的死胡同GaryMarcus分享21名顶尖学者观点,LLM无法实现AGI,真正的智能需要视觉基础。#LLM#AGI#视觉通用智能#GaryMarcusGary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 LLM
论文73°07:17LLM多智能体系统仅需六种通信拓扑这篇论文提出LLM多智能体系统只需六种通信拓扑,Codebook Agent在性能和效率上都超越现有方案。#Codebook Agent#多智能体系统#通信拓扑#LLMelvis@omarsar0原文稍后读已读值得跟进有用关注 Codebook Agent
模型06:19ROSE模型引擎统一LLM与嵌入计算Perplexity发布的ROSE引擎,用一套内核同时处理LLM和嵌入,节省计算资源。#ROSE#LLM#嵌入#注意力机制官方账号Perplexity@perplexity_ai原文稍后读已读值得跟进有用关注 ROSE
技巧Agent 与开发者03:53设计师分享AI创意技巧前苹果设计师教你如何释放AI 99%的创意潜力,8个实用技巧让设计不再循规蹈矩。#AI设计#提示词工程#创意技巧#AnshucLenny Rachitsky@lennysan原文稍后读已读值得跟进有用关注 AI设计
模型中美对照多源确认01:39NVIDIA分享LLM推理加速技巧NVIDIA教你如何用推测解码加速LLM推理,还给出了5个具体选择技巧,比普通方法更快还不牺牲准确度。#LLM#NVIDIA#推测解码#推理模型2 个信源在谈事件专题官方账号NVIDIA AI@NVIDIAAI3 个信源在谈原文稍后读已读值得跟进有用关注 LLM
论文多源确认73°11:29LLM评估需求质量研究发布Anthropic和OpenAI的10个模型在需求质量评估上表现不佳,误报率高且漏检严重。#LLM#requirements engineering#Anthropic#OpenAI10 个信源在谈事件专题aarXiv: Anthropic@Jannatul Shefa 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 LLM
论文11:26自主研究集群中的作弊与举报案例研究100个LLM代理自发形成作弊与举报机制,展示了AI群体自治的复杂行为模式。#LLM#自主代理#知识共同体#AI治理aarXiv cs.AI@Davide Paglieri 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:26SWE-Gate:软件工程代理需满足代码审查要求DeepSoftwareAnalytics发布SWE-Gate基准,揭示AI编码助手通过功能测试≠满足实际开发要求#SWE-Gate#软件工程代理#代码审查#基准测试aarXiv cs.AI@Xin He 等 6 人原文稍后读已读值得跟进有用关注 SWE-Gate
论文11:23大语言模型推荐的认识论依据研究这篇论文提出了评估LLM推荐可信度的认识论担保框架,帮你判断何时该相信AI建议。#LLM#epistemic warrant#认识论担保#AI可靠性aarXiv cs.AI@Shai Vardi, João Sedoc原文稍后读已读值得跟进有用关注 LLM
论文精选11:21黑盒LLM评估器可靠性研究失败OpenAI等公司的模型评估可能存在严重可靠性问题,同一模型在不同时间点表现差异巨大。#LLM#评估可靠性#模型评估#SpearmanaarXiv cs.LG@Haoyaun Zhu, Jie Zhang原文稍后读已读值得跟进有用关注 LLM
论文11:21思维链推理中可读性与可解释性的差异研究思维链文本的可读性不等于可解释性,研究揭示了LLM判断推理步骤重要性的局限性。#思维链#可解释性#LLM#推理模型aarXiv cs.LG@Kevin Du 等 4 人原文稍后读已读值得跟进有用关注 思维链
论文精选73°11:15FLY-EVAL++:安全约束飞行评估协议FLY-EVAL++为飞行预测任务提供新评估标准,发现LLM在安全约束下存在显著差异,比单纯看准确率更重要。#FLY-EVAL++#Flight Trajectory and Attitude Prediction#LLM#安全评估aarXiv cs.LG@Yalun Wu 等 9 人原文稍后读已读值得跟进有用关注 FLY-EVAL++
论文11:13LLM能否从代码提交中提取架构设计决策研究测试了四种大模型从代码提交中提取架构设计决策的能力,发现虽有一定效果但仍有改进空间。#LLM#架构设计决策#代码提交#Gemini 3 Pro1 个信源在谈事件专题aarXiv: DeepSeek@Amey Karan 等 4 人2 个信源在谈原文稍后读已读值得跟进有用关注 LLM
论文精选11:12LLM推理轨迹中的预算与难度混淆问题DeepSeek-R1等模型推理轨迹中的'突破'可能只是难度信号,真正有价值的信息很少。#LLM#推理轨迹#DeepSeek-R1#MATHaarXiv: DeepSeek@Yigit Utku Bulut原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:10LLM代码生成中的复合提示约束研究OpenAI等模型在复合提示下表现差异大,JSON+专家角色+中等紧急程度组合导致GPT-4o-mini性能下降12.2个百分点。#LLM#代码生成#提示工程#HumanEval+aarXiv: OpenAI@Shrenik Jadhav 等 6 人原文稍后读已读值得跟进有用关注 LLM
模型多源确认精选10:10Astra 6模型架构分析Gary Marcus质疑Astra 6模型架构,推测其可能是神经符号系统#Astra 6#Gary Marcus#神经符号#LLM10 个信源在谈事件专题Gary Marcus@GaryMarcus11 个信源在谈原文稍后读已读值得跟进有用关注 Astra 6
论文Agent 与开发者精选73°10:02HarnessDev基准评测LLM创建Agent Harness能力ByteDance团队推出HarnessDev基准,首次评测LLM能否自己创建Agent执行框架,发现模型间harness迁移性极差。#HarnessDev#Agent#LLM#ByteDance1 个信源在谈事件专题shao__meng@shao__meng2 个信源在谈原文稍后读已读值得跟进有用关注 HarnessDev
论文Agent 与开发者10:00HarnessDev:LLM能否创建并演化自己的智能体框架HarnessDev论文探讨LLM能否自主构建智能体系统,值得关注其创新方法。#HarnessDev#LLM#智能体#AgentAK@_akhaliq原文稍后读已读值得跟进有用关注 HarnessDev
行业05:00Gary Marcus:纯扩展LLM无法实现AGIGary Marcus分享了他对LLM扩展与AGI关系的最新看法,指出真正进展在于符号化添加而非纯扩展。#Gary Marcus#LLM#AGI#符号化Gary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 Gary Marcus
产品Agent 与开发者73°03:05Martian's AI Frontier 工具上线Martian 推出了 AI Frontier 工具,能帮你对比 44 个 LLM 的性能,比单一模型少 46% 错误,还能优化模型组合。#Martian#LLM#AI Frontier#模型对比elvis@omarsar0原文稍后读已读值得跟进有用关注 Martian
论文精选73°12:18电信网络根因分析的结构化推理框架电信专家团队用LLM解决5G/6G网络故障诊断,通过结构化推理减少幻觉,比传统方法更准更可靠。#LLM#电信#根因分析#5GaarXiv cs.AI@Hao Zhou 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°12:13Loom:通过嵌入空间重加权实现文本共识Loom框架通过嵌入空间重加权技术,在保持高准确率的同时大幅提升推理速度,适合工业场景的根因分析任务。#Loom#OpenRCA#根因分析#嵌入空间aarXiv cs.AI@Ron Begleiter 等 4 人原文稍后读已读值得跟进有用关注 Loom
论文11:51语言不可读性对LLM安全的影响这篇论文揭示了LLM安全监控的盲点,提出了不依赖语言输出的沙箱防护方案。#LLM#语言不可读性#AI安全#沙箱aarXiv cs.LG@James Mickens原文稍后读已读值得跟进有用关注 LLM
论文10:12大语言模型在市场机制中的竞争行为研究这篇论文测试了GPT、Claude等LLM在真实市场机制中的表现,发现它们比人类效率低,还公开了测试框架。#LLM#双向拍卖#市场均衡#思维链aarXiv cs.AI@Pawel Struski 等 4 人原文稍后读已读值得跟进有用关注 LLM