#LLM
搞 SEO 或 AEO 的朋友该看看:分析了 200 万条 ChatGPT、Claude 等引用数据,发现堆 FAQ、加结构化数据没啥用,内容和用户提问匹配度才是关键。
arXiv 上这篇论文教你把提示词砍到最短还不掉输出质量,还给了三个可操作的压缩框架,写 prompt 的人可以看看怎么省 token。
一篇把 LLM 做日志异常检测的选型问题拆开讲的论文:哪类适配策略有效、量化掉不掉点、噪声下稳不稳,做运维或 AIOps 的可以看看。
Raschka 又更新了,这期手把手教你用 PyTorch 算 token 概率给模型答案打分,还搭了一个 self-refinement 循环,最后跑 MATH-500 看效果。
有人花 5 欧元租 GPU,让无审查版 Qwen 三十分钟改一个字节就破解了 IDM,这帖子把 AI 逆向能力聊得很具体。
Gary Marcus 和 Nate Silver 打起嘴仗了,吵的是现在的大模型到底还算不算"随机鹦鹉",两边观点都挺典型,看看你站谁。
一篇讲怎么修大模型长程推理的方法论文,用代数稀疏化加双曲空间嵌入两种结构引导,12 个基准、7 个模型家族验证,Andrews-Curtis 问题提升 8 倍,代码已开源。
斯坦福团队做了个 StudentBench,拿 2383 人测 AI 教 GRE,效果跟人类导师打平,价格便宜 918 倍,数学部分回得越快学生学得越好。
多机器人协作的新玩法:COMPASS 让一群机器人自己本地算反馈,最多能带 1024 台一起飞,比集中式 LLM 策略稳不少。
这个叫 PASTABench 的新基准测了 16 个大模型给智能体踩刹车的时机,最好的也只拿到 40.74%,还拆穿了不少小模型靠关键词得分。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。