这篇论文把9个主流的智能体通信协议拆成5个维度做分类,告诉你哪种协议适合什么场景,以及未来会怎么演进。如果你在做多智能体系统,想选协议或者设计协议,这篇很有参考价值。
#LLM
共 791 条 · 7 天 48 条 · 30 天 186 条
6月18日
论文10:58
LLM智能体通信协议的技术分类法论文10:57
X+Slides:面向受众条件幻灯片生成的基准想了解如何科学评估AI做PPT的水平?这篇论文用113个主题和8133个探针,测出NotebookLM能覆盖85%的受众关键信息,比DeepPresenter和SlideTailor强不少。
论文10:43
ClaMPAPP混合系统:LLM作为接口、XGBoost作为预测器用于儿科阑尾炎诊断这篇论文提出了一个实用设计:用LLM理解病历文本,但把最终判断交给更可靠的机器学习模型,值得做临床AI的看看。
论文09:42
G-IdiomAlign:基于注释的跨语言习语对齐基准这篇论文搞了个G-IdiomAlign基准,专门测AI能不能理解不同语言的习语。结果模型爱直译,加了注释能好点但还差得远,值得一看。
论文09:40
CADE: 直接时间步嵌入与对比对齐的时间序列问答框架这篇论文提出CADE,解决了LLM处理时间序列时丢了数值信息的痛点,用直接时间步嵌入和对比对齐,在Time-MQA上比GPT-4还强。
Gary Marcus:LLM不可靠,特朗普要求Anthropic加固Fable 5护栏
权威AI批评家Gary Marcus再次发声,直指LLM根本不可靠,加上特朗普政府与Anthropic的对峙,这场AI安全争议你必须了解。
6月17日
IUU+DB:用LLM从文档中提取信息追踪非法捕捞、海鲜欺诈和劳工虐待
这篇论文搞了个IUU+DB系统,用LLM自动从大量文档里挖出非法捕捞和海鲜欺诈的线索,能帮监管者和研究人员快速定位热点区域,挺实用的。
论文09:45
LLM Consumer Behavior Theory:一个新兴研究领域的理论基础这篇论文把LLM当作消费决策的代理人来研究,从经济学角度提出了一个全新的理论框架,适合想了解人机交互市场动态的读者。
论文09:38
可信自组合BDaaS:LLM编排的多智能体框架实现数据工程、AutoML与MLOps自动化这篇论文用LLM编排多个专业智能体,自动搞定数据工程到部署监控的全流程,比单智能体和纯AutoML更可靠,适合做生产级自动化参考。
6月16日
论文11:39
Snyk VulnBench JS 1.0:LLM能否两次发现相同漏洞?这篇论文测试了LLM重复找漏洞的稳定性,发现Claude匹配结果很稳,但自己新发现的漏洞随机性高。建议和安全工具搭配用,别靠它单干。
论文11:13
Phantoms and Disclosures:一个审计合成数据隐私泄露的因果框架想审计合成数据是否偷学了你的信息?这篇论文给出了一个轻量级方案,无需模型权限,只需输出和留出集就能揪出隐私泄露。
论文11:11
CircuitLasso:可扩展的电路学习方法用于解释大语言模型这篇论文提出了CircuitLasso,能以更低成本达到和现有方法一样好的电路学习效果,还能揭示可解释的语义特征如何传播。
6月15日
6月14日