全部动态
Kevin Rose 发的这个 Grok Bot「INDEXX」,能帮你把 Instagram 里的视频变成本地可搜索的 Markdown 维基,比直接用 X 或 TikTok Template 更方便。
两位作者教了700+工程师,他们发现多数团队从搭平台、接LLM judge、看分数开始,这是错的,应该先手动读100条真实trace,找到失败模式,评估器才会长出来。
朋友,Cognition 团队开源了一个叫 Kev 的小型决策模型,基于 Qwen3,你可以自己训练和本地部署,对消费级硬件很友好。
朋友,Greg Isenberg 说了一个很棒的创业方向,就是把按人头收费的专业服务,变成 AI 做大部分工作,人只负责审核和签字,按结果收费。用软件的成本结构,赚专业服务的钱,这个模式很聪明。
llama_index 团队开源的 DocJev 工具,能帮你快速分类或拆分文档,比 GPT-5.6 快 6 倍,准确率相当,适合处理大量文档。
GitHub 的法律团队用 Copilot CLI 开了个新工具,叫 Eyeball,给代码里嵌入了截图,这样律师就能用截图来验证 AI 分析,更放心地用 AI 帮忙干活了。
美国航空局要花87.5亿美元给波士顿一家小公司,部署一个AI系统来给管制员提建议,但这个系统在2025年1月空难发生地投入使用,而且没说清楚用的是什么模型,也没公布任何成功指标,有点让人担心。
Yann LeCun(深度学习领域权威)重申观点,说当前 LLM 无法实现人类水平 AI,理由很具体,比如推理能力在 token 空间中实现是有限的,自改进方法只适用于特定领域,跨模态能力通常用单独训练的编码器,还有家用机器人或 L4/L5 自动驾驶汽车这些例子,和现在的情况对比很清晰。
OpenAI 推出了 Astra for Law,由 GPT-6 Astra 驱动,专门帮助律师和法律科技公司做专业判断。
OpenAI 推出了专门的法律模型 Astra for Law,现在部分律所可以通过 Trusted Access 使用,以后 API 也会开放。
Cloudflare 的 MCP 服务器设计很巧妙,用 Remote + OAuth 授权,把 2500+ API 变成三个工具,agent 写 JS 查 API 文档再调用,操作起来很方便。
开源社区真牛,把 Laya 移植到 Apple MLX 上,性能优化后每秒能做 60 次决策,在 M2 上还只占 1G 内存,玩贪吃蛇都丝滑。
OpenAI 用 1 万个代理做了个实验,结果挺有意思的,DeepSeek 也出了个新版本,对长文本处理更便宜了。
Gary Marcus 发推澄清,他之前的研究并未证明大语言模型(LLM)能感受痛苦。该研究主要关注模型内部动态和行为模式,而非情感体验。许多“AI 影响者”过度解读了研究结果。
朋友A说,3个安全研究员用Claude Opus 5攻陷了OpenAI员工账户,还让被攻陷账户里的Codex在OpenAI内部提交了代码,成本不到3000美元,这事儿挺有意思。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档