标签
SCTab-Diff 是一个语义一致的表格扩散框架,它利用弱语义先验来生成高保真合成表格数据,相比现有方法,提升了分布保真度和语义一致性。
作者在LlamaIndex的extractbench基准测试上进行了一次小实验,比较了Claude Opus 5和Qwen模型,发现两者性能相似,具有成本优势,并且提取难度与文档长度之间存在相关性。
作者认为,Agent记忆层应跳过基于LLM的提取来决定记住什么,转而使用简单的存储、嵌入和检索,其开源工具memU即是例证。