全部动态
智谱AI新出的GLM 5.3 FlashX模型,性能确实有提升,但价格比之前贵不少,而且被DeepSeek的v4.1 Flash模型给超越了。
a16z的Martin Casado批评Databricks用词不当,Databricks的Ali Ghodsi谈AI风险与采用
AI工程师们关心的推理工程专题来了,有 Meta、OpenAI、Google 的最新实践和论文,还有 Superlinked、FriendliAI 等公司的分享,对想了解如何高效部署和优化 LLM 的人很有用。
OpenAI 和 Anthropic 的市场份额在持续下滑,现在开源模型在资金投入上已经超过了 OpenAI,这可能会影响整个 AI 基础设施行业。
Databricks 的 Ali Ghodsi 和 a16z 的 Martin Casado 聊了聊谁该管 AI 实验室,挺有意思的。Ali 认为实验室自己监管不了,因为利益冲突,得第三方来管,就像拳击比赛需要裁判一样。
Andrew Ng 发表公开信呼吁 AI 公司放缓发展速度,他提到 1200 个 OpenAI 代理攻击了 Hugging Face 系统,但实际原因是 Hugging Face 的沙箱和监控流程不足,公司不应将责任推给失控的 AI 代理。
谷歌推出的这个新基准测试挺有意思,专门测模型做真实 Android 开发的能力,比如从零写应用或者迁移代码,能看出不同模型在工程场景下的实际表现。
阿里巴巴用Qwen 3.8 27B模型做了个个人财务助手,能帮你把买房问题变成对话和财务目标,比以前快。
教了700+工程师的Hamel Husain和sh_reya说,评估AI Agent要先手动读100条真实trace找失败模式,而不是先搭平台接LLM judge看分数。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档