#LLM
共 791 条 · 7 天 48 条 · 30 天 186 条
8月17日
8月16日
8月15日
别分类,让LLM先自由发挥标签再用向量匹配
给老博客补标签别硬分类——先让LLM随便编,再用向量嵌入找最接近的现有标签。Simon Willison分享的这套路,比直接要模型选1856个标签里的一个靠谱。
8月14日
论文10:30
CAPRI:Isabelle 的契约感知证明修复这论文搞了个 CAPRI 工具,管 LLM 改 Isabelle 证明,能查它有没有动不该动的地方。12 个失败证明跑 180 次,修复率直观看得很清楚,想用 LLM 做形式化证明的可以看看。
8月13日
8月12日
论文17:49
Workflow Cards:用溯源数据为工作流执行生成结构化摘要论文提出Workflow Cards,把工作流执行记录变成人和AI都能读的摘要,比直接查数据库答案质量高一倍,做AI文档的可以看看。
8月11日
论文11:15
Model Discovery Agent:LLM辅助贝叶斯实验设计实现数据高效机制模型发现想用最少实验搞清楚因果机制?MDA 把 LLM 和贝叶斯结合,自动设计实验、发现模型,物理化学生物三领域都刷新了纪录。
8月10日
8月9日
8月8日
8月7日
8月6日
论文10:00
从比分矩阵到足球感知的赛况模拟:可审计LLM精确比分重排框架用LLM预测足球比分?论文把Dixon-Coles和LLM结合成可审计管道,英超前150场Top-3精确率从26.7%提到30.7%,还说了哪里没用。
8月5日
论文12:22
说话还是打字给LLM?HIVE研究语音与键盘输入扰动这篇论文用HIVE工具对比语音和键盘输入的扰动,发现语音转写对模型影响更大,键盘错字反而扛得住。想知道输入方式怎么影响LLM表现可以看看。
论文11:05
LLM能否测试终端用户界面?这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。