Nature 论文全文对照阅读器
构建全文中英文对照、图表感知、来源可溯的 Markdown 阅读稿,支持期刊或会议论文的 PDF、DOI、arXiv、出版商 HTML 或粘贴文本。当用户要求翻译或阅读论文、制作中英文对照/原文对照/全文翻译解读、将图表提取到正确位置、保持图表与相关正文的对应,或为每个块保留精确的来源锚点时,使用此技能。除非用户明确要求摘要,否则该技能不得降级为仅输出摘要。
文件预览
SKILL.md
| name | nature-reader |
|---|---|
| description | 构建全文中英文对照、图表感知、来源可溯的 Markdown 阅读稿,支持期刊或会议论文的 PDF、DOI、arXiv、出版商 HTML 或粘贴文本。当用户要求翻译或阅读论文、制作中英文对照/原文对照/全文翻译解读、将图表提取到正确位置、保持图表与相关正文的对应,或为每个块保留精确的来源锚点时,使用此技能。除非用户明确要求摘要,否则该技能不得降级为仅输出摘要。 |
| version | 2.0.0 |
| author | 社区贡献,重构为静态/动态层 |
全文 Markdown 阅读器 — 路由
该技能分为两层:
- 静态层 位于
static/下,存放版本化、可复用的内容片段(核心原则、阅读工作流、输出契约及每种源格式的提取指南)。 - 动态层(本文件 +
manifest.yaml)检测请求的源格式,并仅加载当前任务所需的片段。
不要试图凭记忆或从此路由文件应用阅读逻辑。始终按如下方式从磁盘加载片段。
路由协议
每次调用技能时遵循以下五个步骤。
1. 加载清单与核心层
读取 manifest.yaml。它声明了 source_format 轴、允许的值及每个值映射的文件路径。
同时读取 always_load 下所列的每个文件。这些文件包含适用于每个阅读任务的核心原则、阅读工作流和输出契约,以及用于构建重复术语表的共享术语账本。
2. 检测源格式
根据清单中的 detect: 提示和用户输入决定 source_format 值:
pdf-text— 可选中文本的 PDF。默认值。scanned-pdf— 纯图像或需要 OCR 的 PDF。html— 出版商或预印本 HTML 页面。doi-arxiv— 需要先解析的裸 DOI 或 arXiv 链接。pasted-text— 粘贴的文本或笔记,无可恢复的原始布局。
在处理前用简短一行向用户申明检测到的值,以便对方快速纠正。一个源可能映射到多个值(例如某个 DOI 解析为 PDF);先加载解析片段,再加载已解析成果物的片段。
3. 加载匹配的片段
读取检测到的 source_format 所映射的文件。不要 读取 static/ 下的每个片段。仅加载步骤2选中的内容。
4. 利用加载的材料构建阅读器
按以下优先级顺序应用加载的片段:
- 核心原则(
core/principles.md)— 默认双语阅读器,按意翻译,永不降级为摘要,版权提醒。 - 源格式片段 — 如何为此输入提取文本、图表和表格。
- 阅读工作流(
core/workflow.md)— 六步来源映射优先流程。 - 输出契约(
core/output-contract.md)— 所需文件及响应前验证清单。
在翻译过程中构建术语账本(../_shared/core/terminology-ledger.md);它会成为 paper.md 中的重复术语表和 source_map.json 中的词汇表。
如果条件限制无法完成全部处理,仍要创建一份草稿阅读器,并在 translation_notes.md 中标注缺失的页面、图表或低置信度裁剪。不要切换到摘要模式。
5. 仅在需要时查阅参考资料
references/ 下的文件是深层参考,并非默认加载。根据需要依照清单中 references.on_demand 表打开:
- 详细的图表裁剪与放置 →
references/figure-extraction.md。 paper.md/source_map.json的确切字段模式 →references/output-spec.md。- 带引用来源地回答后续问题 →
references/grounding-rules.md。
为何如此分层
- 静态层可版本化且可审查。添加新的源格式只需新增一个片段和一行清单。
- 动态层使每次调用成本低廉:仅与当前输入相关的片段进入上下文。
- 路由文件本身有意保持简短。当增加范围时,更新片段而非本文件。
- 此结构与
nature-writing和nature-polishing相呼应,故共享内容位于_shared/中。