5月31日
09:03
09:03lmarena.ai@lmarena_ai
72°
xAI 的 Grok-Imagine-Video-1.5-Preview 在图像转视频竞技场中排名第一,相比前代 Grok-Imagine-Video 提升了 52 分,超越了 Seedance-2.0 和 HappyHorse 等顶级模型。该模型支持 720p 分辨率输出,标志着 xAI 在视频生成领域的重大突破。这一进展表明 AI 视频生成竞争正加速,xAI 已跻身第一梯队。

推荐理由:做视频生成或关注多模态模型的开发者值得关注——Grok 视频模型首次超越主流竞品,意味着又多了一个高性价比选择,建议去竞技场实测对比效果。
5月30日
02:10
02:10官方账号xAI@xai
83°
xAI 宣布 grok-build-0.1 模型通过 API 进入公开测试阶段。该模型与驱动 Grok Build CLI 的模型相同,专为智能体编程场景优化。定价为每百万输入 token 1 美元、每百万输出 token 2 美元,兼具高性价比、智能性和速度。这是 xAI 在 AI 编程助手领域的重要布局,为开发者提供了新的选择。

推荐理由:做智能体编程的开发者有了一个性价比极高的新选择——grok-build-0.1 定价仅为 $1/$2 每百万 token,且专为 agentic coding 优化,值得在项目中试试它的表现。
5月29日
5月26日
5月22日
11:38
11:38官方一手arXiv: OpenAI@Andrii Kryshtal
精选72°
一项新研究测试了 OpenAI、Anthropic、DeepSeek、xAI 的九款模型在 90 个多轮冲突场景中的表现,发现模型在涉及战争罪行、种族灭绝否认、种族歧视等敏感话题时,输出可能加剧社会分裂。失败率从 6% 到 47% 不等,当用户要求“平衡”报道时,五款模型在 80%-100% 的情况下失败。研究首次提出针对冲突场景的评估框架,呼吁将此类测试纳入模型安全评估体系。
事件专题

推荐理由:做 AI 安全评估或部署在敏感地区的团队,这篇论文给出了第一个可复用的冲突场景测试框架,能直接用来检查模型是否会在关键议题上“和稀泥”——看完你会重新审视“中立”输出的代价。
5月21日
5月15日
5月14日
5月13日
09:12