01:13Jerry Liu@jerryjliu0精选LlamaParse推出表单自动提取功能,设置processing_options.forms='enrich'即可从复杂表单中提取全部字段与值,输出结构化JSON。该功能无需预定义schema,能自动检测每个表单键和对应值,未填写字段返回空白。同时支持识别复选框状态,并附带标准markdown输出。目前该功能以beta形式对所有付费计划开放。AI产品LlamaParseLlamaIndex表单解析推荐理由:LlamaParse现在能把W-2这类表单直接变成JSON,不用写schema,调一个参数就行,省掉一条解析管线。原文稍后读已读值得跟进有用关注 LlamaParse
08:29官方账号Simon Willison’s Weblog(博客/媒体)condense-json 1.1版本发布,在前一版1.0基础上新增两项功能:替换对象的值不再局限于字符串,condense_json()和uncondense_json()可识别并执行结构化替换。此外,对象可作为合并操作的基础,condense_json()能识别近似匹配的对象并记录键的更新或删除指令,uncondense_json()可应用这些合并。新版还引入了基于Hypothesis属性测试库的往返测试。AI产品condense-jsonJSONLLM推荐理由:condense-json 1.1能让JSON压缩更智能,支持对象合并和结构化替换,处理复杂数据时比纯字符串替换强不少。原文稍后读已读值得跟进有用关注 condense-json
00:49向阳乔木@vista8一项针对44个大语言模型的研究发现,当要求模型随机说出一个词时,最热门的答案是serendipity,在正常对话中占比41%。若将输入格式改为JSON,该词的出现概率升至64%。该研究揭示了模型在随机词生成中的系统性偏差。论文serendipityJSON提示词工程推荐理由:这篇论文发现,大模型连'随便说个词'都爱说serendipity,改成JSON格式从41%涨到64%,挺有意思的。原文稍后读已读值得跟进有用关注 serendipity
00:48向阳乔木@vista8一篇论文测试了 44 个模型,发现当要求“随便说个词”时,最热门答案是 serendipity(机缘巧合),占比 41%。如果要求用 JSON 格式输出,该词概率升至 64%。研究认为结构化输出格式会抑制模型回答的多样性。论文serendipity模型多样性结构化输出推荐理由:别让 JSON 扼杀了模型的创意——这篇论文用44个模型的数据告诉你,结构化格式会锁死多样性。原文稍后读已读值得跟进有用关注 serendipity
00:41elvis@omarsar0康奈尔大学一项新研究测试了44个模型,发现要求JSON格式输出会使答案同质化,模态答案比例从41%升至64%,不同答案数量从52降至36。JSON和XML有这种效应,YAML和CSV没有。解码器强制schema不会进一步压缩,说明问题出在模型对格式的响应模式。该发现对依赖JSON模式的智能体管道有重要影响。论文结构化输出JSONXML推荐理由:这篇论文提醒我们,别以为结构化输出只是换个格式,它可能悄悄让模型回答变得更单调。做Agent开发的朋友应该看看。原文稍后读已读值得跟进有用关注 结构化输出
02:06Fireworks AI@FireworksAI_HQFireworks AI 举办免费 DevRel 网络研讨会,演示如何微调开源视觉模型从混乱收据图片中提取结构化 JSON。整个过程在 Fireworks 平台上端到端管理。研讨会已于 10am PST 开始,无法参加的观众可在本周内观看 YouTube 回放。活动还涵盖近期发布和微调入门指南。技巧Fireworks AI微调开源模型推荐理由:想学微调?Fireworks 现场演示用视觉模型从收据扒 JSON,实操干货,错过也有回放。原文稍后读已读值得跟进有用关注 Fireworks AI
01:36Fireworks AI@FireworksAI_HQFireworks AI举办免费月度DevRel网络研讨会,主题为微调开放视觉模型从杂乱收据图片中提取结构化JSON。活动将于本周四上午10点(太平洋时间)开始,全程在Fireworks平台上管理。研讨会包括近期发布介绍和微调入门指导。技巧Fireworks视觉模型微调推荐理由:想学怎么用Fireworks微调视觉模型处理收据数据?这个免费直播手把手教你,还能了解最新工具。原文稍后读已读值得跟进有用关注 Fireworks
11:10官方一手marktechpost@Michal Sutter精选2026年,多数企业数据仍存储在PDF、扫描件和幻灯片中。开源文档提取模型可在本地硬件上将它们转为结构化JSON。但“PDF转JSON”涵盖两种不同问题:架构驱动提取和通用提取。选择合适的模型取决于目标格式和文档类型。技巧PDF提取JSON开源模型推荐理由:这篇指南帮你分清两类PDF提取任务,不用纠结选哪个开源模型。适合自己搭管线的开发者。原文稍后读已读值得跟进有用关注 PDF提取
05:11官方一手marktechpost@Sana Hassan精选本教程基于Lift模型,在Colab GPU环境中以4-bit NF4量化加载,生成含干扰项的合成研究报告,运行模式引导的字段级提取,并对比每个字段与ground truth得分,最终组装为可查询知识库。该方法将Lift用于可重复的提取基准测试,而非一次性演示。技巧LiftJSONPDF提取推荐理由:Lift能帮你把研究PDF变成带字段评分的JSON,还能对抗干扰,比直接用模型更靠谱。原文稍后读已读值得跟进有用关注 Lift
11:12宝玉@dotey作者在 baoyu-skills 项目中尝试用 EXTEND.md 文件保存用户自定义设置。但 Markdown 不是严格结构化数据,导致程序解析困难,格式难以保持一致。作者建议改用 JSON 或 YAML 作为 Skill 扩展配置,既能被 LLM 方便读取,也能用代码解析和保存。技巧baoyu-skillsJSONYAML推荐理由:配置改用 JSON 更靠谱原文稍后读已读值得跟进有用关注 baoyu-skills