#LLM
这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
别人用 8 美元的芯片跑大模型,靠的是 Gemma 的分层嵌入技巧。想低成本部署边缘 AI?这个开源项目就是参考答案。
Applied Intuition 的创始人说物理 AI 会比 LLM 更牛,举了机场里卡车司机的例子,视角很接地气。
一个用Claude写Prolog代码并用LPTP证明正确性的实验。有具体的数字和流程,适合对LLM+形式化验证感兴趣的人。
这篇论文用Petri网编排LLM,自动生成并发Rust API的测试用例,比纯LLM生成的更可靠,能挖到深层并发bug。
这篇论文揭示了LLM中一种不易察觉的修辞滥用,并给出了具体测量和缓解方法,适合关注模型文本风格和RLHF影响的读者。
Gary Marcus解释了现在ChatGPT和Claude比两年前强的原因——它们加了层'Harness'变成神经符号系统了。
这是篇讲多智能体LLM安全漏洞的论文,提出ChannelGuard,不额外调用LLM,在Agent间加门控,能防住工具投毒和指令注入,而且实验用了三个不同模型后端,结果很实在。
Meta 砍一半计算单元、减三分之二显存,搞了个专攻推荐系统的定制 AMD 显卡,对大模型反而鸡肋。看看巨头的特殊需求。
这篇论文解决了财务报表欺诈检测的泛化评估问题,用LLM整合文本数据,在CI-FSFD任务上达到SOTA,适合关注AI金融应用和风险检测的研究者。
这篇论文把LLM智能体怎么用在智能电网上讲得很清楚,给出了具体的数字对比,比如EVAgent减少了7.5倍未满足能量,适合做电网AI系统的实践参考。
这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
这篇论文提出了一种在手机上跑大模型的新思路:不加载全部神经元,只算有用的部分。效果不错,内存和计算都省很多,关键是精度没掉。
这篇论文发现Transformer学算术的方式跟人很像,用教人算术的策略来调模型,效果还真不错,想了解LLM推理机制和可解释性的话值得一看。