Task

general · 首次出现 2026-05-22 · 最近出现 2026-09-12 · 累计提及 264

综述

Task近期进展

OpenRouter发布按任务分类的模型排行榜 OpenRouter

OpenRouter最近发布了按任务分类的模型排行榜,旨在为模型性能提供更全面的评估。

斯坦福研究员提出合成数据推断框架:在历史任务上校准偏差 lmarena.ai

斯坦福的研究员提出了一种合成数据推断框架,通过在历史任务上校准偏差,提高模型的泛化能力。

AtumAI:用智能体自动生成数据中心控制面策略的框架 arXiv cs.AI

AtumAI开发了一个框架,利用智能体自动生成数据中心控制面策略,提高资源利用效率。

看每个task的成本,不只看每个token的成本 shao__meng

在评估模型性能时,需要关注每个task的成本,而不仅仅是每个token的成本。

datasette-apps 0.2a0:为Datasette Agent新增调试工具 Simon Willison’s Weblog

Datasette Agent的新版本0.2a0增加了调试工具,提高了开发效率。

datasette-agent 0.4a0发布:agent工具可直接在浏览器运行代码 Simon Willison’s Weblog

datasette-agent 0.4a0版本允许agent工具直接在浏览器中运行代码。

Pegasus:将人类视频转化为机器人可学习数据的低资源框架 arXiv cs.AI

Pegasus框架能够将人类视频转化为机器人可学习数据,为低资源环境下的机器人学习提供解决方案。

Karpathy的多模态长语音提示方法:用task替代单轮 elvis

Karpathy提出了一种多模态长语音提示方法,使用task替代单轮,提高交互效率。

Inkling在Agent Arena中排名开放模型第9,总体第30 lmarena.ai

Inkling在Agent Arena中表现出色,开放模型排名第9,总体排名第30。

SearchOS-V1:面向开放域信息检索的多智能体协作框架 arXiv cs.AI

SearchOS-V1框架支持多智能体协作,用于开放域信息检索,提高检索效果。

当前焦点与观察点

当前,Task领域的研究主要集中在模型性能评估、数据推断、智能体策略生成、成本优化、开发工具改进等方面。随着技术的不断发展,Task的应用场景越来越广泛,未来有望在多个领域发挥重要作用。

相关报道

10 条在档