7月27日
16:14
16:14官方账号Decoder@Matthias Bastian
Anthropic的Claude共享聊天记录因页面缺少noindex标签,短暂出现在Google搜索结果中。用户发现这些页面包含加密密钥和法律问题等敏感信息。OpenAI去年也因同样错误将ChatGPT共享聊天暴露在搜索引擎中。Anthropic已修复该问题,但引发隐私担忧。
事件专题

推荐理由:Claude共享聊天记录居然被Google搜到了,里面还有加密密钥。Anthropic又犯了OpenAI的老毛病,看看怎么回事。
10:55
10:55官方一手arXiv: Anthropic@Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann
论文提出SIREN方法,通过PAIR越狱循环自动编辑检索到的网页内容,操纵大语言模型的推荐排名。在124次试验中,SIREN在Claude 3.5 Sonnet和Claude 3 Opus模型上实现62次目标实体升至排名1。使用23种内容投毒技术(如声明性排名声称和种子列表),并在新会话中复现成功率达0.805。这是首个在固定源上下文下研究生产级LLM推荐排名操纵的受控实验。
推荐理由:这篇论文教你如何通过修改网页内容让大模型推荐时把你想要的东西排第一。SIREN用PAIR越狱循环,在Claude模型上成功率80%,挺有意思的。
7月26日
13:31
13:31Jerry Liu@jerryjliu0
精选
Jerry Liu 分享使用 Claude Code 的经验,指出过度约束模型会导致其无法探索未知问题。他发现移除大约 80% 的 Claude Code 系统提示词后,模型能利用上下文自行判断,效果更佳。他推荐 Opus 5 模型在 Claude Code 中表现优异。
事件专题

推荐理由:别老想着给模型写满约束,Jerry Liu 发现拿掉 Claude Code 八成提示词模型反而更聪明。
7月25日
09:09
09:09官方账号Simon Willison’s Weblog博客/媒体
精选
Anthropic 的 Claude Opus 5 在提示注入(prompt injection)防护上取得显著进展。根据官方系统卡和红队评估,Opus 5 是 Anthropic 迄今最难以被成功提示注入的模型。这一结果基于多项 PI 评估和对抗测试,标志着大模型安全性的一次重要提升。
事件专题

推荐理由:Anthropic 的 Opus 5 在防提示注入上做到了史上最强,红队测试都很难攻破,安全团队值得关注。
02:53
02:53cat@_catwu
76°
Anthropic 推出 Claude Opus 5,定位为“ thoughtful and proactive”模型。官方宣称其前沿智能水平接近 Fable 5,但价格仅为后者一半。该模型擅长长时间自主工作,适合复杂任务场景。
事件专题

推荐理由:Claude Opus 5 价格只有 Fable 5 的一半,性能差距不大,适合预算有限又想要前沿能力的团队尝试。
02:07
02:07官方账号Replit@Replit
Replit 在本月发布多项更新,新增语音与Agent对话功能,用户可直接用语音指令与AI交互。支持从Claude或Slack启动构建流程,无需手动切换工具。Agent现在能记住用户的技术栈,无需重复解释。这些更新旨在提升开发效率,让AI助手更无缝融入工作流。
事件专题

推荐理由:Replit 这次更新很实用,能用语音指挥Agent,还能从Claude或Slack直接开始写代码,再也不用手动交代技术栈了。
7月24日
19:13
19:13The Rundown AI@therundownai
OpenAI和Anthropic几乎同时发布了语音功能的升级。OpenAI升级了ChatGPT的语音模式。Anthropic为Claude推出了新的语音接口。两家公司在AI语音助手领域的竞争进一步加剧。
事件专题

推荐理由:OpenAI和Anthropic同一天出语音升级,AI语音助手大战开打。想试试最新语音聊天?关注这两家的更新。
14:08
14:08@koltregaskes@koltregaskes
一篇X帖子要求OpenAI在Codex中提供GPT-5.6 Pro。发帖者指出Ultra并非推理层级,而是使用High推理或混合模式,并运行子智能体而非单一智能体。Claude的Ultracode类似但采用动态工作流。Max是最高推理层级,默认隐藏。
事件专题

推荐理由:OpenAI的Codex缺了GPT-5.6 Pro,而且Ultra和Max的概念容易混淆。看看这位用户怎么说。
11:04
11:04官方一手arXiv: Anthropic@Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof
本研究通过提示Claude生成Prolog代码和测试,并使用LPTP进行形式化证明。Claude为前33个P-99问题生成了58个逻辑过程、508个测试和257个引理(共11800行证明)。作者手动检查了所有代码和证明,验证了类型、终止性、唯一性等性质。该实验展示了“vibe-coding/vericoding”方法用于Prolog编程的可能性。
推荐理由:一个用Claude写Prolog代码并用LPTP证明正确性的实验。有具体的数字和流程,适合对LLM+形式化验证感兴趣的人。
04:47
04:47@koltregaskes@koltregaskes
OpenAI已将GPT-Live语音模式集成到Codex中。该模式与ChatGPT内的版本相同,仍缺乏推理能力。用户表示更期待Claude的Opus驱动语音模式,但目前不确定是否已发布。
事件专题

推荐理由:OpenAI把语音模式放进Codex了,但和ChatGPT版一样没啥推理能力。想等Claude Opus语音模式的可以关注下。
03:03
03:03techcrunch@Ivan Mehta
Anthropic为Claude语音模式更新了更强的基础模型,新版本支持更自然的对话交互。用户可以通过语音指令安排会议或草拟邮件。此次更新提升了语音识别的准确性和响应速度,但没有提供具体的基准测试分数。
事件专题

推荐理由:Anthropic给Claude语音模式换了更强模型,现在能用语音直接安排会议或写邮件,比之前更流畅自然。
00:53
00:53Gary Marcus@GaryMarcus
Gary Marcus指出,当前用户使用的ChatGPT/Claude并非纯大语言模型(LLM),而是结合了“Harness”的混合系统。他将这种组合称为神经符号AI架构。这一变化解释了为什么2024-2025年的模型相比2022-2023年的纯LLM有明显性能提升。
推荐理由:Gary Marcus解释了现在ChatGPT和Claude比两年前强的原因——它们加了层'Harness'变成神经符号系统了。
7月23日
21:36
02:45
01:07
01:07官方账号Decoder@Matthias Bastian
72°
AMD向Anthropic投资高达50亿美元。作为协议一部分,Anthropic将部署2吉瓦MI450 GPU用于训练和运行Claude模型。这是AMD继Meta和OpenAI后的另一笔重大AI芯片交易,旨在挑战Nvidia的主导地位。批评者认为此类协议构成循环现金流动。
事件专题

推荐理由:AMD砸50亿美元给Anthropic换2吉瓦GPU订单,Claude要用AMD芯片了,和Nvidia抢生意。
7月22日
16:45
16:45量子位@量子位的朋友们
78°
百度文心助手任务Agent在国际权威智能体评测榜单上综合得分第一,超越Claude和GPT。该Agent在任务分解上表现优于Claude,在代码执行上优于GPT。百度文心助手任务Agent此次登顶国际权威榜单证明其智能体能力。
推荐理由:百度文心搞的Agent居然干翻了Claude和GPT,拿了个全球第一,挺牛的,值得看看。