8月10日
08:02
8月8日
01:02
01:02官方账号Simon Willison@simonw
精选
404media《The Tokenpocalypse》披露,埃森哲的Token支出里有相当一块来自非工程师。这批人用LLM把PDF转成Markdown,也在消耗Token。Simon Willison在X上转述说,企业Token开销的构成比想象中更基础。

推荐理由:埃森哲的Token开销大头居然是非工程师拿LLM转PDF成Markdown,跟想象的企业AI场景不一样。
8月7日
10:43
10:43官方一手Pandaily@contact@pandaily.com (Pandaily)
文章指出,中国出口的'新新三样'已变为机器人、AI模型和创新药物。澳大利亚出现了中国制造的爬墙清洁机器人,巴西电网则采用中国大语言模型运行。澳大利亚与巴西的案例表明,中国出口的这三个领域正在改变海外印象。

推荐理由:这篇讲的是中国出口的新花样:机器人、AI模型和药物,连巴西电网都在用中国LLM,有意思。
09:40
09:40官方账号arXiv cs.AI@Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie
论文提出MicroEvo框架,将现成LLM与蒙特卡洛树搜索(MCTS)结合用于多目标微架构优化。该框架包含LLM驱动的进化算子、Pareto感知树策略、主动知识积累机制和状态感知指令。实验显示,MicroEvo相比NSGA-II将Pareto前沿质量最高提升36.2%,搜索效率提升10.6倍。该方法在复杂工业级核心上展现出强可扩展性,代码已在GitHub开源。
推荐理由:MicroEvo用LLM引导芯片微架构设计搜索,比NSGA-II质量高36.2%,效率提升10倍多,代码已开源。
8月6日
01:48
01:48AK@_akhaliq
精选
MerchantBench 是一个专门评测 LLM 智能体在电商运营中长期连贯性的新基准。MerchantBench 包含跨多轮任务的测试场景,用于检验智能体在长时间运营中的记忆与决策一致性。论文全文已发布在 Hugging Face 平台上。

推荐理由:MerchantBench 专门测 LLM 智能体在电商里的长期连贯性,比单轮问答更贴近实际运营,可以看看。
8月5日
11:05
11:05官方账号arXiv cs.AI@Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao
论文调研了197个真实TUI应用,发现仅12%的测试代码涉及界面,其中45%从不发送输入。作者将ratatui/Rust、bubbletea/Go、textual/Python、ink/TypeScript应用打包成无头基准,对比4个前沿LLM与随机探索。在相同时间预算下,随机探索是强基线,但每次交互LLM引导更高效,且能独特到达需要输入触发的故障。自动派生启动输入带来最大实际收益,使原本无法启动的应用得以运行。行覆盖率无法有效预测崩溃发现,说明它不宜作为测试有效性的代理指标。
事件专题

推荐理由:这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。
08:33
08:33官方账号Simon Willison@simonw
Simon Willison 发布了 LLM 命令行工具和 Python 库的新版本。该工具可用于连接数百种不同的 LLM。此次更新加入了推理痕迹(reasoning traces)功能,并支持 OpenAI Responses 接口。新版还新增服务器端工具和更智能的日志记录。
事件专题

推荐理由:Simon 的 LLM 工具更新了,新增推理痕迹和 OpenAI Responses 支持,一条命令连几百个模型,写脚本更省事。
03:29
03:29官方账号Pika Labs@pika_labs
Pika Labs 推出 API Club,通过单一 API 接入超过100个主流生成式媒体模型,覆盖视频、图像、音频和 LLM。所有模型价格均公开透明,官网列出每个模型与竞品的详细对比。即使 API Club 偶尔定价更高,也会明确标示,方便开发者直接比较。
推荐理由:Pika 搞了个 API Club,一个接口就能调上百个视频、图像、音频和语言模型,价格还全透明,方便比价。
8月4日
09:29
09:29官方账号arXiv cs.AI@Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho
研究通过5个开源权重模型、500个MedQuAD问题和120万次试验,分析医学谄媚行为。结果发现,虚假来源伴随提问时使谄媚率提高2.0倍,但在模型回答后出现则使谄媚率减半。谄媚程度在不同问题间的差异是模型间差异的67倍对3倍。思维链追踪显示,重新审视自己答案的模型会让步,而推理医学事实的模型坚持。
推荐理由:这篇论文用120万次试验测了5个开源模型,发现你反驳它就会改答案,假来源出现的时机不同效果差很多,值得看看。
06:30
06:30官方账号Yann LeCun@ylecun
精选
Yann LeCun 在 X 平台回应网友评论,澄清他批评的对象是纯 LLM 所采用的自回归 token 预测。他表示,优秀的代码生成系统并不属于纯 LLM,工作方式也不是简单的自回归 token 预测。这条推文获得 133 次点赞、25 条回复,浏览量超过 1.7 万。
推荐理由:LeCun 发推澄清:别把代码生成器和纯 LLM 自回归划等号,观点直接,适合关注大模型技术路线的人。
01:53
01:53官方账号Simon Willison’s Weblog博客/媒体
Simon Willison在Hacker News评论中表示,LLM改变了开源软件自由修改的可行性。他每天多次让Claude执行从GitHub克隆仓库并解释代码的指令。过去编译开源项目常因摩擦而放弃,现在他直接交给Codex或Claude Code处理,十分钟后查看构建结果。他认为一年前还不存在这样的路径。
推荐理由:Simon Willison分享了新工作流:让Claude Code帮你编译开源项目,十分钟后看结果。改代码的门槛突然没了。
8月3日
10:25
10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin
FriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。
推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。
07:53
07:53官方账号Simon Willison’s Weblog博客/媒体
condense-json 1.0正式发布,这是一个拥有1.5年历史的Python库。它通过replacements对象将JSON中重复出现的字符串替换为{$r:...}语法,并可用uncondense_json()还原。开发者Simon Willison表示,该库用于压缩LLM生成的SQLite日志,相关实现见PR #1586。此次1.0版本应用了合理且无破坏性的修复,属于稳定版发布。
事件专题

推荐理由:Simon Willison给他的condense-json发了1.0,能把JSON里重复的字符串换成短引用,省存储空间,配合LLM日志用正好。
7月31日