Anthropic 把 Haiku 升到 5.5,OSWorld 分数从 15.7 涨到 72.4,价格还砍了 90%,不过新 tokenizer 会多吃 token,实际省多少得算算。
#Claude
Anthropic 新出的 Haiku 5.5,100k 上下文,比 Haiku 4.5 便宜 10 倍,跑批量任务的成本压力小多了。
Anthropic 放出了 Claude Haiku 5.5,比 4.5 便宜七成五,还能在 Agent Arena 里跑真实任务,去试试手感。
Anthropic 又发新模型了,Haiku 5.5 比 4.5 便宜 75%,跑批量任务可以直接用它,重的活留给 Opus。
写代码经常用 Haiku 的朋友看下价格,10 万 token 内输入一毛钱一百万 token,Sonnet 缓存读取也砍半了
Anthropic 的小模型 Haiku 5.5 开始推送了,有人已经在用了,官方还没正式公告,想第一时间试试可以刷一下自己的模型列表。
Anthropic 的小模型更新了,Haiku 5.5 比 4.5 便宜约 75%,跑批量任务或对延迟敏感的应用可以留意下价格变化。
Anthropic 把 Haiku 升到 5.5 了,写代码和让模型操作电脑都比 4.5 强一截,用轻量模型跑任务的朋友可以看看。
Anthropic 把 Sonnet 5.5 的缓存读取砍价一半,长会话应用能直接省 20% 成本,跑 Agent 的可以重新算账了。
Anthropic 的新小模型 Haiku 5.5 来了,比 Haiku 4.5 便宜七成五,跑批量任务和高并发场景可以先试试。
Haiku 5.5 来了,10 万 token 以下比 Haiku 4.5 便宜 10 倍,跑工作流或 API 调用的成本直接打一折,可以试试。
Anthropic 把 Haiku 5.5 成本降到 4.5 的四分之一左右,还首次加了 effort 调节,Sonnet 5.5 缓存读取价格也砍半,跑大量 Agent 的可以算算账了。
Anthropic 家最便宜最快的模型来了,比上一代省 75% 成本,还能调推理强度,跑智能体和电脑操作任务的可以看看。
Mistral Large 4 预览版冲进 WebDev 榜第45名,价格只有 Claude Opus 4.8 的六分之一,10月底还会开源。
Claude 家最便宜的小模型升级了,成本砍到原来的四分之一,性能还逼近 Sonnet 5.5,能调 effort 很实用。
Anthropic 的 Haiku 5.5 价格跟 GPT-6 Luna 打平了,10 万 token 内输入只要 $0.10,选模型时可以对比看看。
Anthropic 把 Claude 直接塞进 Google Workspace 了,写 Sheets 公式、跑 Python 清数据、改 Docs 不乱格式,用 Google 全家桶的可以试试这个公测。
一天里 Mistral 放出万亿参数模型,OpenAI 的 Decisions API 快 10 倍,Claude 还能直接嵌进 Google 文档用了,几条都跟开发者钱包有关。
xAI 给 Grok Bot 加了自动选模型功能,写作用 Claude、画图用 Midjourney、做音乐用 Suno,一个入口全搞定。
一个做 X 广告投放的博主吐槽:Claude 封号不退 200 美金,X 企业账户剩一万多广告费却全被拒审、客服失联,海外用钱的朋友可以看看
博主用 opus-5.5 把两年前的风扇控制工具重构成炫酷 WPF 面板,还打包成 skill 分享了,讲怎么把模型能力沉淀成自己的资产。
Anthropic 给付费用户加了个新东西:Claude 能直接在 Google Docs、Sheets、Slides 里干活,还能反过来在 Claude 页面上改 Google 文件,跟之前 Microsoft 365 版一个路数。
SemiAnalysis 实测了九家 AI 订阅套餐,发现 Claude 在中档模型上价值领先 OpenAI 5 倍,且 OpenAI 刚刚大幅削减了套餐额度。
Nat Eliason 晒出他跑学校业务的一整套机器人工作流,邮件、会议纪要、写代码开 PR 全是自动的,想搭自己的智能体系统可以抄作业。
Anthropic给不同信任级别的安全团队分级开放Claude Mythos 5.1,GLM-5.3已被证明能生成接近Mythos的漏洞。
Anthropic 报告挖出中国工作室用 Claude 批量运营 20 多款交友 App,75% 用户是 AI,真人只负责视频通话,套路挺细。
Claude 创始团队成员 Boris 分享了一条简单提示词,让 Opus 5.5 做出带水彩插图的播客互动网页,重点是自我验证那一步。
Every 团队把自己的工作流塞进一个 Claude 智能体,全公司通过 Slack 共用,还开放给了订阅者,做法挺值得参考。
Stanford 拿 5 个模型实测发现,多个智能体抢共享资源时互相覆盖,Opus 5 团队只拿到 30% 价值,单智能体能拿 64%,做多智能体系统前建议先看看。
CodeRabbit 拿真实 CVE 隐藏答案考了四个安全智能体,Devin 和 Claude 的分数差距挺意外,写测试方法那部分很实在。