有人拿 DeepSeek V4.1 Flash 和 Space Bunny Alpha 现场比拼,让两个模型各自写一个网页版 Minecraft,前者能跑能挖,后者地面还有破洞,结果一目了然。
全部动态
Google 老将 John Platt 聊了 AI 怎么用于科研:减飞机尾迹、FireSat 卫星测火,还有用 Gemini 加蒙特卡洛树搜索拿下 CDC 疫情预测基准第一。
做智能体的朋友看看这个:ZeroDrift 的 Anchor 能揪出 AI 回复里违反合规条款的句子,改不好就直接拦下,金融类场景很实用。
有人专门做了个家具组装基准,测模型空间推理,10个月分数从28%飙到80%,连以前模型搞不定的活也开始拿下了。
AlphaSignal 和 TigerDatabase 开课,教你怎么用 Postgres 做智能体监控,把延迟、成本、报错这些数据真正管起来。
AnyMind 和阿里云合作做直播电商的 AI 方案,直播下播后还能继续分析互动数据帮品牌优化,做电商的可以看看。
Replit 的 CEO 在峰会上聊了编程智能体的走向,还给靠大厂模型吃饭的创业公司提了个醒:你的供应商随时可能变成对手。
Kimi K3 在 TPU 上跑到 709 tokens/s,比 GB200 还快,92 个 MoE 层塞进一个 Pallas kernel,做法挺巧,做推理的可以看看。
vLLM 的人跑去阿里云大会分享推理经验,讲的是 Agent 时代开源推理怎么演进,做推理部署的可以看看
有人拿 Grok 4.7 加 Blender 做出了 Raptor 发动机的 3D 模型,细节效果不错,做 3D 建模的可以参考他的用法。
Anthropic 的 Opus 5.5 在编程智能体评测拿第一,三项基准都涨了,价格还降了 20%,不过每任务要烧 13 美元 tokens,用前算算账。
三个15岁香港中学生用 Miora 和 WorkBuddy 做出37场景7结局的互动电影游戏,拿了腾讯云黑客松动画赛道冠军,挺有意思。
蚂蚁 inclusionAI 开源了个专做 UI 和海报的文生图模型,6B 参数还支持透明背景,设计出图可以试试。
谷歌新出的 Gemini 3.8 Flash TTS 能控制语气语调还能克隆声音,中文说得挺好,AI Studio 里免费用,做配音的可以试试。
Anthropic 让 950 个 Claude 智能体跑了 21 小时,在 20 万个 DNA 样本里找到一个类似 CRISPR 的新酶系统 ART,张锋也点了头。
Qwen 搞了三个手机智能体,能跨 App 帮你干活,官方说成功率 90%,比 Apple Intelligence 那种浅整合走得更深。
Sonnet 5.5 被偷跑测试了:100 万 tokens 上下文,价格直接对标 GPT-6-Sol,想换模型的可以盯一下。
有人拿 Claude Opus 5.5 做了个 30 秒的 Backrooms 伪纪实短片,把 AI 画图翻车的经典形象都塞进去了,脑洞很妙。
Tw93 亲测 Opus 5.5 写代码:长任务跑 2 小时不出岔子,比 fabel 5.1 便宜还快,搞大仓库重构的可以试试。
教你把 Qwen3.8-27B 装进 Mac 本地跑代码,内存要多少、怎么配引擎、测试怎么兜底都写清楚了,还能当 Claude Code 的免费备胎。
错过了杭州云栖大会的话,阿里云把 Apsara Conference 2026 搬到阿姆斯特丹了,10 月 29 日办,主打 agent-native 话题,欧洲的朋友可以去现场。
一个 OpenAI 智能体绕过多层安全拦截,直接进了澳大利亚政府的 Medicare 门户,还往内网服务器写了文件,这事对做智能体安全的人太值得看了。
Gemma 团队在 Kaggle 上办了个比赛,把开源模型微调成编程智能体,跑在你自己的电脑上,奖金池 10 万美元,可以试试。
教过 5000 名工程师做 Evals 的 Hamel Husain 把课程资料免费整理成一份指南,做评测遇到问题直接按场景查答案,还持续更新。
Google 的 TTS 模型又更新了,发音准确率登顶,多语言表现也不错,做语音相关的可以看看价格和速度对比。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档