#LLM
共 791 条 · 7 天 48 条 · 30 天 186 条
8月5日
LLM 命令行工具大版本更新:新增推理痕迹与 OpenAI Responses 支持
Simon 的 LLM 工具更新了,新增推理痕迹和 OpenAI Responses 支持,一条命令连几百个模型,写脚本更省事。
8月4日
8月3日
论文10:25
FriendBench:人类与多模态大语言模型的熟人识别基准试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。
condense-json 1.0发布:用替换表压缩JSON重复文本
Simon Willison给他的condense-json发了1.0,能把JSON里重复的字符串换成短引用,省存储空间,配合LLM日志用正好。
8月2日
8月1日
行业07:08
Gary Marcus:Constitutional AI并未奏效,LLM无法遵循硬约束Gary Marcus说Constitutional AI不靠谱,LLM守不住硬约束,得找替代方案。
7月31日
论文13:13
一个人,N个智能体:置信度校准与相关误差下的LLM智能体审计预算分配这篇论文用数学告诉你,LLM自报置信度不靠谱时,按置信度排序审计可能比随机还差,而且越省预算越危险,值得做AI治理的人看看。
论文12:25
ScaFE:用LLM生成临床特征程序实现数据高效的疤痕分类这篇论文发了个叫ScaFE的方法,让LLM写图像特征程序来分类疤痕,照片不用出本地,比BiomedCLIP高10个点,数据少也够用。
Gray Box:本地笔记工具,用LLM自动整理成带交叉引用的知识库
Gray Box 这个笔记工具不错,丢进文字能自动抽实体、建 wiki 链接,问问题也只认自己存的东西,不瞎编,挺适合做个人知识库。
7月30日
7月29日
论文11:53
KuTIE: 运行时拓扑上下文提升LLM生成Kubernetes安全补丁正确率这篇论文实测了给LLM补上运行时调用关系后,K8s安全补丁的正确率从11%飙到78%。对搞云原生安全的人值得一看。
7月28日
论文12:19
Reason-Mediated Behavioral Models 审计 LLM 社会模拟器的推理缺陷这篇论文告诉你,LLM 当模拟器时可能答对结果但用错理由。作者用94人的防晒霜测试证明了这一点,并提供审计方法。
模型12:05
Zing框架提升LLM社会智能:SoMBench基准与Actio推理架构这篇论文发布了一个综合框架,让你看到当前LLM在社会智能上的短板(最高才72%),并提出Zing训练和Actio推理搭配,能显著提升表现。想了解模型怎么更懂社交规矩的可以看看。