有公司发布了只返回概率数字的 Jev 模型,有人拿它做了语义查找和网页打分插件,Simon Willison 却说这是黑箱倒退,两边观点都看看。
#Simon Willison
Simon Willison 拿他标志性的鹈鹕测试试了 Claude Haiku 5.5,还把新价格拆开算了笔账,想选便宜模型的可以看看
Mistral 放出 1T 总参、49B 激活的 Le Chonk,Simon Willison 亲测能画出鹈鹕 SVG 了,10 月底开放权重。
Simon Willison 每月私货通讯,9 月聊了 Fable 级模型、定价战和 Datasette 遇上的漏洞风波,10 美元就能提前一个月看。
Simon Willison 贴了一段 Muse Agent 自己写的汇报:代跑腿出了岔子,它自己分析错在自动回复撒谎,还主动提议改话术。想看 AI 智能体怎么处理现实失误的可以看看。
Simon Willison 把 2026 年的 agent 出逃、OpenClaw 爆红、模型王座更迭串成一条线,信息量很大,读完对全年脉络就清楚了。
Simon Willison 把让 Claude 做互动页面的提示词和全程记录都放出来了,想学怎么写提示词的可以直接抄作业。
Simon Willison 和 Jesse Vincent 要在旧金山办一场智能体工程线下交流,可以带自己的奇怪实验去聊,不用做 PPT,10月14日。
Simon Willison 把 Claude Opus 5.5 和 GPT-6 两个版本放在同一套画鹈鹕测试里对比,想快速了解三者差别看这篇就够了。
Simon Willison 说 Claude 的 auto-mode 帖子应该叫“击败致命三连”,看看他为什么这么说。
想学怎么用Claude Code for web处理带截图的复杂任务?Simon直接把他用的提示词贴出来了,照着试就行。
smevals 是 Simon 和 Prime Radiant 做的小工具,专门跑模型和提示词的评估,一条命令就能用,适合快速看效果。
Simon Willison 教你把普通 --help 输出变成 agent 技能,shot-scraper 就是个例子,省掉额外写技能文件的麻烦。
Simon Willison 用 GPT-5.5 写了这个 Web 组件,能自动从 GitHub 链接抓取指定行的代码显示在网页上,带行号,做文档或博客嵌入代码很方便。
Simon 给 shot-scraper 加了视频录制,写个 YAML 就能自动生成应用功能演示视频,省去手动录屏时间。
做智能体开发的团队必须警惕这三个风险叠加——Simon Willison 的框架帮你快速判断是否需要沙箱,建议直接对照检查自己的智能体架构。
Claude Fable 5 的“大模型气味”揭示了当前顶尖模型的取舍——慢、贵但能力惊人。做复杂推理或高难度任务的开发者,值得看看 Willison 的实测感受,判断它是否值得你的预算。
Simon Willison 点出了 AI 编程时代被忽视的关键——对话记录比 Git 提交更有价值,做 AI 辅助开发的团队建议立即调整工作流。
数据开发者可以直观体验 AI 智能体与 Datasette 的结合,直接上手试试 agent.datasette.io 的交互效果。
Simon 用五分钟讲清了 LLM 过去半年的关键转折——编码代理从玩具变成生产力工具,做 AI 开发或重度使用编程助手的团队值得花五分钟了解这个趋势,看完会对模型选择和工具策略有更清晰的判断。