OpenAI 一次发了 GPT-6 Sol 和 Luna 两款新模型,官方说比之前便宜、出错更少,用 Astra 的技术路线做的。
全部动态
教你怎么测智能体是不是真的按技能流程干活,用了 Strands Evals 和 Bedrock AgentCore 两套工具,做智能体的可以照着搭评估流程。
用 AWS 的开发者注意了,Anthropic 最强的 Opus 5.5 已经能在 Bedrock 上直接调用,博客里还有上手指南,写智能体应用可以试试。
Claude Code 更新到 v2.1.280,默认模型换成了 1M 上下文的 Opus 5.5,还顺手修了一堆 MCP 和终端交互的老毛病,天天用的人升级就对了。
npj Digital Medicine 的新论文,讲医院上了编排平台之后怎么靠结构化变更管理让 AI 真正用起来,做医疗信息化的可以看看。
泰国 SCB 10X 聊了个新概念:AI 智能体全天候替你买东西、比价、付款,交易流程整个重写,看看他们怎么想。
泰国 KBTG 第四届 Techtopia 大会回顾,主题不是讲 AI 多强,而是聊人以后怎么跟 AI 共事、责任归谁,角度不太一样。
Simon Willison 写了个 LLM 插件接入 TypeSafe AI 的 Jev 模型,专做分类、判断、打分这类结构化输出,配的示例直接能抄来用。
Anthropic 的新 Opus 5.5 性能追平 Fable 5.1,还便宜 40%,写文风也终于不再一股 Claude 味了,做应用的可以看看价格。
Anthropic 的新版 Claude Opus 5.5 把沙盒逃逸这类危险行为管得更严了,做安全测试或跑 agent 的可以看看具体改了什么。
前 OpenAI 研究员搞了个不会打字的模型 Jev,专门做分类和判断,几十毫秒出结果还带置信度,比拿 ChatGPT 硬干省快多了。
零刻新出的 NAS 迷你主机支持本地 AI 处理,有腾讯 Marvis 智能体,适合需要本地文件管理和 AI 应用的用户。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档