#提示词工程
共 1272 条 · 7 天 149 条 · 30 天 783 条 · 话题观测 →
9月21日
9月20日
YouMind用图做PPT效果最好,Gemini 3.8 Flash生成速度快
朋友用YouMind直接用图做PPT,效果超好,指定模板后图像几乎和原图一样,改文字或改图都很快,Gemini 3.8 Flash速度还快。
B站「AI无限竞技场」用真实场景评测大模型,GPT6-Astra登顶
B站搞了个「AI无限竞技场」,让UP主用真实任务测试AI模型,比如给个屎山代码项目让模型PK,或者让不同模型玩狼人杀。比那些刷分、炫技的评测靠谱多了。
Browser Use + Jev 发布超快开源浏览器 Agent,搜索航班仅 7 秒成本 0.0039 美元
朋友,Browser Use 和 Jev 这两个团队搞了个超快的开源浏览器 Agent,搜索航班 7 秒搞定,成本才 0.0039 美元,比之前那些慢得多、贵得多的版本强多了。
软件开发瓶颈从“写代码”转向“定义问题”
老哥 @thorstenball 说,以后写代码的活儿可能没了,因为模型能写900行零错误的代码,而人只能审查系统组合方式。现在写代码的“手艺”会消失,但“构建软件的手艺”更重要,比如理解业务问题。
LiveOverflow 分析利用恶意 HEIF 图片攻击 OpenAI 的过程
朋友,LiveOverflow 分析了怎么用一张恶意 HEIF 图片攻击 OpenAI,挺有意思的,可以看看他们是怎么做的。
从零手搓 SGLang 的开源课程
Datawhale 和 RadixArk 联合发起的开源课程,教你从零手搓 mini-sglang,最后能对照真实 SGLang 源码提 PR,适合想深入了解 LLM 推理引擎的人。
TypeSafe AI 推出 Jev 'System One' 模型,提供 Skills 安装方式
TypeSafe AI 的 Jev 'System One' 模型,除了官方提供的 Playground 和 API 文档,用户还能直接安装官方 Skills,方便集成到 Agent 中。
OpenRouter 推出 Ori Eval 工具,量化评估模型适用性
OpenRouter 新出的 Ori Eval 工具,能帮你量化评估不同模型,直接运行命令就能知道哪个模型最适合你的项目,比凭感觉选模型更靠谱。
9月19日
AI Agent 评估多数团队从搭平台、接 LLM judge、看分数开始
教了700+工程师的Hamel Husain和sh_reya说,评估AI Agent要先手动读100条真实trace找失败模式,而不是先搭平台接LLM judge看分数。