Perplexity 把 OpenAI 那批 722 篇数学论文全做成了解说视频,共 93 小时,在 YouTube 直接看。
#Perplexity
Perplexity 的 Decider V1.1 在 DecisionBench 拿了第一,准确率 93.9%,每千次决策才 0.016 美元,做决策路由的可以看看。
Perplexity 出了开源嵌入模型,小的 0.6B 能跑在边缘设备上,大的 9B 在 MADQA 拿了 92.4%,MIT 协议可以自己部署。
Perplexity 晒了个有意思的 demo:自家 Decider 决策模型接进 EVE 推理栈,直接速通《谁想成为百万富翁》答题,喜欢看模型实测的可以瞧瞧。
Meta 的 Muse 智能体要直接装进 Windows 了,还集成 MXC SDK,Perplexity 也有能离线跑的端侧工具,普通用户用智能体门槛更低了。
Perplexity 把两个嵌入模型开源了,9B 做索引、0.6B 能跑在手机上,PDF 不用 OCR 直接搜,成绩还挺好。
Perplexity 开源了两个 late-interaction 嵌入模型,文本图像网页一个空间里查,做 RAG 的可以上手试试。
Perplexity 放出了自家的搜索嵌入模型评测,0.6B 小模型就追平了大号 nemotron-embed-8b,做 RAG 检索的可以看看。
Perplexity 实测 GPT-OSS-120B 做搜索代理,BrowseComp+ 拿了 64.0%,比 ColBERT 高 4.9 分还搜得更少,搞 RAG 的可以看看。
Perplexity 放出了开源的决策模型 v1.1-27b,价格砍半到 $0.02/百万 token,还拿了 HF Decision Index 0.3 第一,可以拿来试试。
有人拿 8 个决策模型打 Tetris,Perplexity Decider 稳居第一,还能自己在 playground 里复现,挺好玩的。
OpenAI 把搜索直接内置进 API 了,Artificial Analysis 实测便宜过 Perplexity,但多跳检索还打不过 Octen,做联网应用前先看看这份数据。
Perplexity 老板聊了个有意思的现象:有用户每月烧 1 万美元跑 agent 业务,Meta 工程师人均年花 1000 万美元用编程工具,讲透 agent 时代的新算力经济学。
Perplexity 演示在 Computer 里搭了个 GeoGuessr 式应用,看图猜地点还配 3D 卫星视图,SDK 加浏览器控制全自动,玩法挺开脑洞。
Perplexity 的 Computer 代理跑了几个小时,把纽约 26000 家餐厅做成能走进去的 3D 地图,还能按菜名搜,演示挺直观。
Perplexity 的 Agent API 现在能把 agent 配置存成版本化 Profile,一次配置多个应用复用,还接了 GitHub、Slack 这些连接器,写 agent 的可以试试。
Perplexity 在招研究员,方向是多智能体和合成数据,出钱还开放研究成果,9 月 30 日前可申请。
Perplexity 和 Nvidia 搞了个沙盒 SPACE,让 9 个模型拿 root 权限试着越狱,108 次全没跑出去,搞智能体安全的可以看看。