全部动态
教你怎么测智能体是不是真的按技能流程干活,用了 Strands Evals 和 Bedrock AgentCore 两套工具,做智能体的可以照着搭评估流程。
NVIDIA 的 Nemotron Labs 搞了场专家直播,专门讲怎么评估 Agent 技能,做智能体开发的话可以看看他们的评估思路。
宝玉实测的省钱组合:贵的模型出方案,便宜的模型干活,再让贵模型自动验收,全程不用人工盯。Token 贵的都该看看这套闭环玩法。
LangChain 和 TypeSafe 今天下午直播,教你怎么用 Jev 搭 agent harness,写智能体的可以报名听一下。
Simon Willison 写了个 LLM 插件接入 TypeSafe AI 的 Jev 模型,专做分类、判断、打分这类结构化输出,配的示例直接能抄来用。
前 OpenAI 研究员搞了个不会打字的模型 Jev,专门做分类和判断,几十毫秒出结果还带置信度,比拿 ChatGPT 硬干省快多了。
OpenRouter 介绍了 Jev 的 Classifiers 功能,能自动给你的 LLM 请求打标签,再到 Explore 页面看各场景的用量分布,运维排查很方便。
博主分享自己的多 Agent 编程工作流:Fable 写方案文档,Opus 照着执行再验收,比 plan 模式更好复用,值得抄作业。
有人用 24G 内存的 MacBook Pro 本地跑 Qwen-Image-2.1,一张图要等 5-6 分钟,没显卡想本地跑生图的先看这个再决定。
Tw93 让 AI 用 computer use 装卸了 549 款 Mac 软件,把 Mole 的卸载残留规则补了一遍,过程挺开眼。
Latent.Space 新一期采访 TypeSafe CEO Jev,聊为什么聊天机器人做不成可靠自动化,观点挺反共识。
Benchling 在 Bedrock AgentCore 沙箱里跑智能体代码,再用 DNS 防火墙堵外泄,这套多层隔离方案能直接抄。
Sydney Runkle 用不到 10 分钟讲清 Typesafe AI 的 Jev 是什么、怎么接进你的 agent,想上手看这条就够。
Positron 这款数据科学 IDE 登陆 SageMaker 了,R 和 Python 一个界面搞定,教程从 Athena 查数到部署 XGBoost 全流程带你走完。
人去钓鱼电脑干活:GrokBot、Workbuddy 这些带手机端的 Agent 客户端,出门也能让任务继续跑。
让 AI 用 Computer Use 装卸 300 款 Mac 软件打磨 Mole 的清理规则,AI 还自己写脚本省事。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档