- 发布日期
多元寻迹使用指南:怎样搜索、筛选并判断档案来源
- 作者

- 姓名
- 多元寻迹
- 社交账号
『多元寻迹』不是一个把网页重新复制一遍的通用搜索引擎,而是中文多元性别及相关文化资料之上的统一发现入口。搜索使用完整静态索引:浏览器先读取 manifest,再按需加载按来源切分的内容寻址分片。搜索结果的作用是帮助用户找到原始发布者、档案页和可验证的出处,而不是取代这些来源。
完整索引的规模会随新增来源、数据修复和重新生成而变化。首页显示的索引来源数、可搜索记录数和限制级记录数直接来自当前静态 manifest;需要判断某个来源收录了多少记录、其中有多少限制级记录、由谁发布、有什么时效限制时,可以进入来源档案查看对应的来源页。这样比把一个容易过期的总数写死在指南里更可靠。
先从具体词语开始
搜索具体名词通常比输入宽泛概念更有效。例如,与其只搜索“跨性别”,可以尝试:
- 跨性别医疗、荷尔蒙、嗓音训练、性别肯认手术;
- 非二元、性别流动、性别表达;
- 家长手册、校园、职场、证件、法律;
- 变装、CDTS、性转、变身文学;
- 某个作者、作品名、机构名或新闻事件。
不同来源采用的词汇并不完全一致。没有结果时,可以换用同义词、繁简体、英文缩写或更短的词组。例如“非二元性别”也可以尝试“非二元”“non-binary”;“跨性别医疗”也可以拆成“跨性别”和“医疗”。
使用筛选缩小范围
高级搜索支持按来源、标签、年份和地区缩小结果。筛选适合以下场景:
- 已知资料类型:只想查看新闻、文档、漫画、文学或机构资料;
- 关注特定时间:寻找某一年的新闻、研究或存档;
- 关注地区语境:区分中国大陆、台湾、香港或其他地区的资料;
- 结果过多:先用关键词检索,再逐步增加一个筛选条件。
不要一开始同时加入过多条件。旧资料的元数据可能不完整,年份、地区或标签缺失并不代表内容无关。较稳妥的方法是从关键词开始,再逐项收窄。
怎样理解一条搜索结果
一条索引记录可能包含标题、描述、来源域名、日期、标签、地区、文件格式、大小、原始链接或档案链接。历史档案、失效网页和批量导入资料尤其可能缺少日期或作者;站点不会为了让页面看起来完整而猜测未知字段。
判断资料时可以依次查看:
- 来源是谁:政府机构、学校、公益组织、媒体、个人站点、社区档案还是文学仓库;
- 内容何时产生:发布日期和存档日期是两个不同概念;
- 是否仍然适用:医疗、法律、服务机构、资助计划和活动信息很容易过期;
- 是否为原始版本:存档副本用于保存,不一定是发布者当前维护的版本;
- 是否有明确限制:转载、翻译、研究摘要和社区经验不能互相替代;
- 是否标为限制级:限制级是索引分级信息,记录仍然可以搜索,访问原始来源时应同时遵守来源本身的年龄提示、访问条件和内容规则。
对于医疗、法律、心理支持和现实服务信息,应优先核对原机构的最新页面,并在需要时咨询合格专业人士。档案可以帮助理解历史与背景,但不能自动保证今天仍然准确。
用来源档案检查出处和覆盖范围
/archive/ 是搜索索引的来源目录。每个来源页会说明发布者、地区、资料类型、可搜索记录数量、限制级记录数量、索引分片、来源依据以及需要注意的时效问题。它特别适合回答几个常见问题:
- 这个结果究竟来自哪个机构或档案库?
- TS Index 对这个来源是整站索引、精选页面还是入口级收录?
- 一个小型机构来源为什么只有几条记录,而大型档案为什么有多个分片?
- 这个来源中有多少记录带有限制级分级?
- 医疗、政策、服务和活动资料是否需要回到原站核对新版?
来源页本身只提供原创说明和用于搜索的元数据,不复制第三方正文。对于政府报告、教学附件、社区手册和文学作品,版权与使用条件仍由原发布者或原档案站决定。
原始网页与档案副本有什么区别
原始网页通常最接近发布者当前维护的版本,也可能包含最新勘误、联系方式和更新说明;档案副本则更适合解决网页消失、域名失效或内容被修改后的可追溯问题。
两者都很重要:
- 需要采取现实行动时,优先检查原始站点的最新信息;
- 研究历史变化时,档案版本可能更有价值;
- 原始网页失效时,档案副本可以保留基本内容与出处;
- 两个版本不一致时,应记录差异,而不是假定其中一个永远正确。
限制级记录也属于完整搜索索引
限制级是一项分级信息,不是删除、隐藏或排除索引记录的条件。静态索引生成时会识别被标记为受限的来源、明确标记为受限的记录,以及位于 限制级 路径中的记录,并把这一状态保存为 restricted 分级;这些记录和其他记录一样进入内容寻址分片,参与浏览器搜索、来源统计和完整索引计数。
构建过程还会独立计算源索引中的记录总数,并要求 manifest 的 sourceDocuments 与 totalDocuments 完全一致。只要记录仍然存在于有效源索引中,就不能仅仅因为来源、记录或路径被分为限制级而让搜索索引变少。分类驱动的删减会直接使静态产物验证失败。
TS Index 的搜索层保存的是用于发现、导航和判断来源的元数据与链接,不因为限制级分类删减现有索引记录,也不把分级本身当作质量判断。原始站点的访问条件、版权、年龄提示和内容规则仍由来源本身决定;搜索结果会保留“限制级”标记,方便用户判断。
搜不到不等于不存在
搜索结果为空可能有多种原因:
- 相关站点尚未被发现或接入;
- 网页禁止抓取,或只能在登录后访问;
- 页面已失效,尚未找到可验证的档案;
- 当前索引只包含有限元数据,查询词没有出现在可搜索字段中;
- 资料使用了不同词汇、繁体字或英文名;
- 数据源刚刚更新,静态索引尚未重新生成。
因此,站点运营不仅要维护搜索代码,也需要持续发现新来源、检查失效链接、补充元数据、记录拒绝或延后接入的原因,并说明索引覆盖的空白。
什么样的来源值得加入
候选网站或页面至少应满足以下条件中的大部分:
- 与中文多元性别、跨性别、非二元、性别表达或相关文化直接相关;
- 具有明确来源、作者、机构或可追溯的发布背景;
- 对用户提供独特信息,而不是大量复制已有内容;
- 可以公开访问,并允许合理的元数据索引或引用;
- 页面结构和链接相对稳定,能够长期维护;
- 涉及医疗、法律、服务、资助或活动信息时,能说明更新时间和适用范围;
- 普通与限制级分类可以被可靠标注,但分级本身不用于删减索引。
整站接入和单页收录不是一回事。结构清晰、持续更新、来源明确的网站可以评估整站接入;高价值但结构复杂、版权限制较强或更新不稳定的来源,更适合只收录入口和少量关键页面。重复页面、过期服务目录和没有独特信息的镜像,即使容易加入,也不会为了增加新增来源数量而收录;但已经存在于有效源索引中的记录不会因为限制级分类被删除。
接下来会持续改进什么
站点的长期工作包括:
- 每天发现和审核新的中文资料站与高价值页面;
- 修复构建、部署、完整覆盖、失效链接和搜索体验问题;
- 为每个索引来源维护可抓取的来源介绍、分级与覆盖说明;
- 使用可复现的固定查询检查结果稳定性、误报和漏报;
- 发布数据质量、来源变化、保存方法和主题资料清单;
- 让每条可索引内容拥有更清楚的来源、时间和上下文;
- 在只读分析数据可用时,用聚合证据评估哪些页面和来源真正帮助了用户。
这篇指南会随着搜索方式、数据结构和来源范围变化而更新。最重要的原则仍然是:把搜索结果当作通往原始资料和档案证据的入口,而不是脱离来源的最终结论。