标签
研究人员首次系统性地从OpenAI、Anthropic、Google的闭源模型中提取隐藏思维链,利用API加密兼容漏洞让较弱模型解密,从而绕过CoT蒸馏防护,并研究了Kimi K3、GLM-5.2、DeepSeek等开源模型。
LiteParse 现在支持从 PDF 中提取结构化数据——表单字段、复选框状态、注释、图像、矢量图形和词级边界框——无需视觉模型,并提供复杂度信号,将更困难的页面路由到 LlamaParse 等工具。
Boris Cherny 发布了一篇关于图工程的7页PDF,展示了如何通过构建一个持久的代理知识图谱,使用四个Claude提示词替代训练好的ML模型,步骤包括提取、解析、总结和查询。
文章概述了五种工作流程,用于在Fable 5(前沿AI模型)从订阅制转向按Token计费之前,从中提取智能信息,重点捕捉廉价模型无法复制的判断力和知识。
讨论关于 ML 团队是否真的在生产中测试模型安全风险(如提取和投毒),并指出模型的安全审查落后于常规软件。
Hyper-Extract 是一个开源框架,可将混乱文档转换为类型化知识结构,支持多种图谱架构(如 GraphRAG、LightRAG 和 KG-Gen),拥有 10 多种提取引擎和 80 多个面向不同领域的 YAML 模板。
本文提出SafeLLM,一种基于提取的方法,用于从安全关键文档中检索信息,表明行号选择在减少幻觉的同时保持高召回率方面优于基于重写的RAG方法。
作者分享了一个将网页转换为 design.md 的开源工具,使用简单,只需发送网址即可提取设计文件。
Parse-Flow 是一个开源的可视化工作流设计器,它将文档智能原语(解析、提取、分类、拆分)组合成可复用的流水线,底层基于 LlamaIndex 和 Python 工作节点。
AI搜索引擎从页面中提取并改写内容,优先选择可引用、有证据支持的材料,而非通用摘要。内容创作者应专注于为引用而写作,而不仅仅是点击量。
kg-gen 是一个开源 Python 包,通过语言模型(借助 LiteLLM 和 DSPy)从纯文本或对话消息中提取知识图谱,具备分块、聚类和灵活的路由提供商功能。
有人开发了一个神器 designmd.me,只需输入网站 URL 即可一键提取完整的设计系统(配色、字体、组件、布局),自动生成 DESIGN.md 文件。配合已有 5.4 万星的 awesome-design-md 仓库,能快速复刻顶级品牌的 UI。