Ethan Mollick 晒了用 GPT-4o 做的教学实验:当 Tutor 用成绩涨且能保持,让 AI 代写涨分就没了,家长老师都该看看
#GPT-4o
研究者做了个数据集专门判断评审点子是人写的还是 AI 写的,发现 AI 想法大多离不开论文本身,人会带外部知识进来,挺有意思的角度。
MIT 实测 GPT-4o、Claude 这些模型玩拍卖游戏,发现让它们“多想想”反而更差,一句话说明规则就能把错误率从 4.2% 降到 0.2%,写提示词的都该看看。
Simon Willison 用 Colin Fraser 的老加法实验测本地 Qwen 3.8 27B,还对比了开不开推理模式的结果,想本地跑模型的可看。
有人在 DGX Spark 上重跑了 GPT-4o 的文字加法实验,Qwen3.8 27B 开推理后 169 次只错 2 次,还能看到逐位进位的思考过程。
OpenAI 拉了 80 多位心理医生做了个心理健康对话基准,GPT-6 Astra 考了 57.3 分,GPT-4o 只有 32.1,想看模型心理对话靠谱程度可以关注这套评测。
OpenRouter 默认换成了 GPT-4o Image 2.5 Flare,专门做视觉内容创作和产品原型,比之前的更适合设计师和开发者。
这篇论文把EffiBench、EvalPerf等流行代码性能基准的漏洞全翻出来了——1538个任务里只有6%能真正测出差异。他们搞了个多智能体框架自动生成更刁钻的测试,效果直接翻四倍。
Seedream 5.0 图像模型刚上线,能生成 2K 分辨率图片,比 GPT-4o 清晰,但文字多时会糊。想试试新模型可以看看这些例子。
这篇论文搞了个标准协议EPC,专门用来测LLM代理系统里评估器偏好怎么耦合的,还附带了GPT-4o、Qwen、DeepSeek等8个评估器的大规模实测数据,方便你复现和对比。
这篇论文实打实比较了GPT-4o、Mistral和DSIT-Taxonomies在提取基金提案实体上的能力,Mistral准确率90.5%碾压对手,做科研数据挖掘的可以看看。
零样本GPT-4o当教育顾问爱多管闲事?实测误报率43%,换成Decision Transformer或XGBoost就能准到几乎零误报。