Grok 4.7 已经能在 Genspark 里直接用了,价格没涨,编程和长任务表现更强,可以试试换着用。
全部动态
25 个 PM 岗位近一半要求会写 evals,这篇续篇教你哪些步骤别跳过,还带免费插件让 agent 干活
Jay Alammar 那批写《Hands-On Large Language Models》的人开免费直播课,75 分钟讲清楚不用框架怎么把 LLM 拼成 Agent,适合想补基础的开发者。
腾讯混元的 Hy Image 3.5 preview 上 ComfyUI 了,文字渲染和人物一致性都有提升,玩工作流的可以试试。
Matt Palmer 把自己 YouTube 频道的字幕、标题、缩略图全交给 Grok Bot 干了,模板公开,装上就能用。
xAI 把 Grok Bot 当客服员工用,工单涨 175% 没招一个人,成本降到几毛钱,部署三步法抄作业就行。
一天之内 Opus 5.5、GPT-6 Sol/Luna、Grok 4.7、Mimo v2.6 全来了,Opus 5.5 还降了 40% 成本,这篇帮你梳理各家提升方向和 benchmark。
StepFun 把自家 Coding Agent 开源了,跑分还行,作者顺手整理了国内各家开源编程 Agent 的 GitHub 链接,选型可以直接抄。
藏师傅那个 1 万多 star 的中文去 AI 味工具更新了,吸收了上游迭代和 issue 里的反馈,写文案被 AI 味困扰的可以去试试
Qwen 的图像模型这次在 LMArena 两个榜单都是开源第一,图像编辑拿到 1367 分,总榜离 GPT-Image-1.5 只差 3 分,做图的朋友可以试试。
有人在比 GPT-6-Luna 和 DeepSeek-V4.1-Flash 的实际成本,短上下文选 Luna,272K 以上大输入选 DeepSeek,做 agent 的可以看看怎么省钱。
Tw93 把 Mac 上 611 款软件的 AI 自动化实测做成了可查清单,关键发现是无障碍属性能让 AI 定位元素更准,独立开发者很该看看。
Anthropic 的 Boris Cherny 拿 Opus 5.5 写 Lean 验证 Claude Agent SDK,几条提示词修出 16 个 bug,并发代码排查可以抄这个思路。
浏览器操作智能体的性价比榜刷新了,GPT-6 Sol 比.Opus 便宜三倍还高分,挑模型前可以看看这份数据。
低配显卡党福音:Unsloth 把 Qwen-Image-2.1 量化到 12GB 显存就能本地生图,6GB 显存走 FP8 offloading 也能跑,质量还对标 Nano Banana 2.0。
做 AI 产品的话这篇挺实用:Ramp、Shopify、Cursor 这些公司靠写 evals 把指标提了多少,还附了个免费插件让编码 Agent 帮你干活。
宝玉用同一份超详细提示词,让 Opus 5.5 和 GPT 6 Astra 各做一个能逛的 3D 樱花山谷网页,截图摆一起看差距。提示词本身就值得抄走。
Simon Willison 把 Claude Opus 5.5 和 GPT-6 两个版本放在同一套画鹈鹕测试里对比,想快速了解三者差别看这篇就够了。
GPT 6 Sol 和 Luna 直接砍半价,Benchmark 上比 Opus 5 便宜 10 倍,同天 Claude 也降价了,这波价格战值得看看对比数据。
Pika 出了个 Swap Anything,能把视频里的角色、道具甚至整个场景换掉,动作节奏还不乱,做视频的可以试试。
Perplexity 分享了怎么让 Computer 模型从自己的错误里学习,A/B 测试里工具调用失败率降了 21.2%,做法挺值得看看的。
LlamaIndex 跑了 ParseBench,Opus 5.5 解析 PDF 表格比 Opus 5 高 7 个点,但每页 5.8 美分不便宜,文中还对比了 LlamaParse 的替代方案。
OpenAI 的 GPT-6 Sol 和 Luna 已经能在 Augment 的 Cosmos 里直接用了,他们还打算把整套 GPT-5.6 工作流迁过去,想看迁移实测数据的可以蹲一下。
OpenAI 把 GPT-6 Astra 的能力下放到了 Sol 和 Luna 这两个便宜一半的型号上,批量跑任务的可以看看价格。
有人把 Claude Design 和 Figma MCP 做设计的方式对比了一遍,一个直出可交互原型,一个还在 Figma 里改,非设计师看第一条就够选了。
Vercel 又更新 Next.js 评测了,GPT-6 Sol 首秀就并列第一,Grok 4.7 便宜一半到七倍,选模型前可以看看这份榜单。
在搞生产级 agent 部署的朋友可以看看,讲的是 EKS 加 NVIDIA 加 LangChain 这套组合怎么落地,能注册去现场听。
OpenAI 出了个缓存仪表盘,能直接看到你哪些 prompt 被复用了、哪次改动把缓存搞失效了,还给出受影响的 token 数,省钱利器。
OpenAI 给 GPT-6 的 API 上线了更好的提示词缓存,默认命中率更高,缓存输入最高打一折,跑智能体的成本和延迟都能降下来。
OpenAI 出了个提示词缓存的调优教程,教你设 cache breakpoints、调 reasoning effort 还不丢缓存,做应用的开发者可以直接抄作业。
如果你用 Claude Code 跑长任务,经常遇到 Opus 5.5 干一半停下来汇报,Anthropic 这条提示词直接解决,拿去用。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档