#GPT
共 104 条 · 7 天 9 条 · 30 天 30 条
8月29日
8月26日
8月21日
8月20日
8月14日
8月13日
8月10日
CoDyControlBench:复杂动力系统反馈控制器设计的LLM基准与推理蒸馏
论文搞了个新基准CoDyControlBench,测了6款模型,GPT成功率最高94.8%,还蒸馏出1.5B小模型能上机械臂干活。
8月9日
8月6日
8月5日
用 DeepSeek V4 Flash 总结帖子,5 分钟内容 1 分钟看完
geekbb 用 GPT 扩展配 DeepSeek V4 Flash 总结长帖,5 分钟变 1 分钟,1 分钟变 10 秒,适合懒人。
8月3日
7月29日
论文11:10
Evaluating VLMs for Agent-Driven Geometry Clipping Detection in Game QA这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。
7月28日
7月27日
行业21:14
韩国企业引入海外 AI 模型遇成本难题,三星等巨头实施 Token 配额制三星为了省钱,给员工用 AI 设了 Token 配额,超了还得证明自己效率高才给提。韩国企业这波 AI 落地很真实,可以围观一下。
IT之家原文
论文12:18
LLM部署配置如何塑造伪科学验证:Claude/Grok/GPT/Gemini测试这篇论文用四个主流模型实测了伪科学评估,发现Grok的Fast版本评分奇高,而且同一个模型API和Web结果差十几倍。看完你就知道模型答案多不可靠,值得所有AI用户看看。
7月24日
论文09:21
GPT和DeepSeek在安全协议分析中的表现评估这篇论文用具体数据告诉你,GPT和DeepSeek在形式化验证上还比不上ProVerif这些专业工具,但推理模式能把精确率拉到66%,可能当个预筛选过滤器。
7月23日
7月22日
7月20日
7月18日
7月17日
7月16日
7月15日
7月14日
7月13日
7月9日
Databricks内部测试:Pi harness成本减半,GLM 5.2开源编码智能体性能提升
Matei Zaharia刚透露Databricks实测:用Pi harness成本省一半,效果和Opus、GPT一样好;GLM 5.2这个开源模型也追上来了。
7月8日
7月7日
7月6日
7月3日
论文09:53
Bias-Aware Bayesian Active Top-k Ranking with LLM Judges用贝叶斯方法修LLM当裁判时的废话偏好和位置偏差,实测召回从0.5拉到接近1,比直接投票靠谱多了。