朋友问,ChatGPT、Claude、Gemini 和 Grok 这四款主流 AI 都说了啥,它们认为 AI 导致人类灭绝的风险里,机器人主动攻击人类是最不可能的,而人类滥用 AI 制造生物武器、发动网络攻击才是更现实的问题。
全部动态
DeepSeek 新出的 V4.1-Flash 模型,在 Ollama 云端上线了,比之前的小模型更智能、更快,还能处理图片,适合 Max 和 Team 帐户的用户。
OpenAI 推出了 GPT-Live-1 实时语音模型 API,支持打断处理和工具调用,能帮你快速构建全双工语音应用,比之前的方案更高效。
DeepSeek 新发布的 V4.1 Flash 模型,推理速度更快,价格也降了 60%,比之前的 V4 Pro 强很多。
Anthropic 的报告里,阿里用 Claude 做自己模型的案例特别有意思,还有智谱用 Claude 攻击其他模型的细节,值得看看。
NVIDIA 新发布的 Nemotron 3 Embed 8B 模型在网页检索任务上表现很棒,比之前的一些模型更好。
NVIDIA 新发布的 Nemotron 3 Embed 8B 模型在网页搜索相关任务上表现很好,值得看看。
Devin Desktop 和 CLI 现在支持 SWE-2 了,这个模型在主要评估基准上和近期前沿模型得分相当,但成本能降低 70%,挺香的。
朋友,Cognition 推出了 AI 工程师模型的语音功能,你直接对着浏览器说指令,它就能帮你完成开发任务,比纯文本输入更方便。
朋友,Deepseek 新出的 552B 大模型现在在 Fireworks 上能用,做编程和网络安全很厉害,比 GPT 5.6 Sol 便宜很多。
OpenAI 新发布的 GPT-Live-1 语音代理,在 Tau3 测试中比之前的 GPT-Realtime-2.1 表现更好,能更流畅地处理客户对话和工具调用。
Cognition 公司发布了 SWE-2,这个模型在 Kimi-K3 上微调后,在 FrontierCode 基准上表现更好,成本也更低。
NVIDIA 的 Cosmos 3 Nano 模型在 AI City Challenge 中拿了奖,是交通视频预测方面的好工具。
Venture Twins 用 Grok @bot 当网站界面,自动处理健康保险门户的繁琐任务,比手动找信息、研究需求、写邮件方便多了。
Genspark 推出了专门用于知识工作的 Gen-1 Slides 模型,能以更低成本生成高质量的演示文稿,和 Opus 5 有明显价格差异。
朋友发了 Genspark 的 Gen-1 Slides,这个模型做幻灯片生成很厉害,和 Claude Opus 5 一样好,但价格便宜很多,才 1/17。
朋友,Deepseek 新出的 552B 大模型现在在 Fireworks 上能用,编程和网络安全方面比 Opus 5 强,还便宜很多。
Anthropic 发表了他们最详细的威胁情报报告,里面讲了有人怎么用 Claude 做坏事,比如搞网络攻击和制造武器,他们还成功阻止了这些行为,值得看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档