#AI评估
共 35 条 · 7 天 3 条 · 30 天 11 条
信息流里打上「AI评估」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月2日
10月1日
9月30日
9月29日
9月24日
9月19日
9月17日
9月15日
9月10日
Vals AI CEO:企业需可防御的AI评估
Vals AI CEO谈企业如何通过独立评估体系 justify AI投资ROI,当token spend可能超过salary spend时,评估体系决定企业生死。
9月9日
9月7日
9月6日
9月2日
9月1日
8月28日
8月6日
7月31日
谷歌 Gemini 3.5 Pro 短暂现身 Arena,上线 30 分钟即被移除
谷歌跳票几个月的 Gemini 3.5 Pro 突然在盲测平台露脸半小时又被撤,想看看它真实水平的人可以去翻用户截图。
IT之家原文
7月27日
7月17日
7月8日
6月30日
6月23日
LangChain与Fireworks AI微调Qwen模型,构建100倍更便宜的trace judge
LangChain搞了个低成本trace judge,用阿里Qwen微调,性能不输顶级模型还便宜100倍,做trace监控的可以看看。
6月18日
论文10:56
Beyond Algorithms:医学影像AI概念创新视角论文想知道医学影像AI领域的科研方向出了问题在哪?这篇Perspective论文直接点出算法竞赛之外的概念缺失,给实验室和期刊提出了改进建议。
6月15日
6月12日
论文10:27
任务可交换性:用合成数据做有效统计推断的新框架合成数据在科研中越来越常见,但偏差问题一直让人头疼。这篇论文给出了一个可操作的统计框架,让做社会科学调查或AI评估的研究者可以放心地用合成数据做推断,值得关注。
6月5日
行业12:47
Logan Kilpatrick:创建公开AI基准测试的Alpha机会巨大做 AI 评估或模型开发的团队,现在投入公开基准测试能抢占先机——Logan 点出了这个被忽视的蓝海,建议关注并尝试创建自己的测试集。
5月30日
5月11日
论文11:45
AI评估方法论:从用例到场景的转化流程该研究直面AI评估领域的方法论碎片化问题,提出的结构化流程和人类中心设计原则为业界提供了可操作的标准化评估框架,尤其对金融等高风险行业的AI系统评估具有直接参考价值。
arXiv cs.AI原文