- 发布日期
TS Index 索引覆盖与每周更新记录
- 作者

- 姓名
- 多元寻迹
- 社交账号
这是一份持续更新的覆盖与数据质量记录,而不是把每天的操作日志搬到公开网站。它回答几个长期有用的问题:TS Index 当前能搜索多少条记录、覆盖多少个来源域名、限制级内容是否仍包含在完整索引里、最近增加了哪些可追溯来源,以及哪些数字能够由静态产物直接验证。
所有总数都以发布时的 search-indexes/manifest.json 为准。来源页面和搜索结果会继续变化,因此这里保存的是有日期的发布快照;首页与来源档案显示的是当前部署版本。
2026-09-21:84 个来源域名,39,447 条可搜索记录
本周发布后的完整静态索引包含 39,447 条来源记录和 39,447 条可搜索记录,覆盖 84 个来源域名。其中 27,052 条带有限制级分级;构建与发布门禁继续要求重复 canonical URL 诊断为 0,并要求 sourceDocuments = totalDocuments = 所有 document shard 记录数之和。
与 2026-09-14 的 39,435 条记录、75 个域名相比,本周净增加 12 条可搜索记录和 9 个来源域名。新增来源仍以逐页审查的小型第一方机构、大学、媒体、人权组织和研究记录为主,因此来源多样性的提升明显大于记录规模增长;这不是靠扩张大型镜像档案得到的数字。
限制级内容在本周继续完整保留:27,052 条限制级记录仍包含在同一搜索语料中。新接入的普通级来源没有触发删除、隐藏、降级或重分类;分级仍然只描述内容属性,而不是收缩搜索覆盖的条件。
本周新增覆盖重点
跨性别历史与文化。 本周加入香港理工大学关于晚清跨性别历史的学术讲座记录、酷兒翻越 Queer Margins的当代跨性别/女性主义写作,以及本次新增的世新大學性別研究所「跨性別人權工作坊」历史页。世新页面记录 2013 年工作坊,并由研究所在 2018 年重新发布;索引明确区分活动日期、网页保存时间与 2026 年查阅时间,不把历史术语或制度背景改写成当代共识。
人权、制度与公共记录。 香港性别承认跨部门工作小组补充性别承认制度讨论的官方历史材料;國家人權委員會提供 2026 年跨性别/双性人兵役体位争议的第一方人权意见;風雨蘭 RainLily则增加跨性别及性别多元人士性暴力经验调查的机构记录。法律、兵役与倡议材料都保留发布日与机构立场边界,调查结果也只在原样本范围内解释。
新闻、校园与社会研究。 《報導者》新增跨性别亲密关系与社群内部差异的深度新闻线索;香港科技大学 University Event Calendar保存跨性别校园对谈记录;香港大学社会科学学院保存跨性别男性生命史研究讲座。新闻个人叙事、研究样本与单次校园活动都不会被泛化成全体跨性别者的经验。
本周发现但未接入的候选
来源数量仍不是 KPI。本周继续暂缓了一批看似相关但边界不足的页面:当前无法稳定匿名访问的大学页面、跨性别只占一个参与条件的综合活动、以可识别个人生命史为主体的学生新闻、用户生成的政策/公民新闻,以及需要额外临床或法律 freshness 复核的敏感研究。搜索结果缓存、二手转载或一次性的宽泛提及,都不能替代可直接核验的 canonical 与清楚的 provenance。
为什么小型精选来源也值得加入
一个只有一条记录的来源不一定比拥有数千条记录的大档案价值低。对研究者而言,第一方政府页面、大学活动记录、机构研究 portal、博物馆展览页和社群历史项目往往能回答“谁在什么时间发布了什么”这一类 provenance 问题。
TS Index 因此区分“来源覆盖”与“记录规模”。大档案有助于全文发现,小型精选来源则提高出处多样性、历史可追溯性和地区覆盖。新域名只有在直接相关、公开可访问、发布者可识别、canonical link 稳定并且 metadata 范围可安全维护时才会接入;不会为了让来源数好看而增加重复、宽泛或无法核验的网站。
本周的数据质量边界
本周继续维持几个不会为了增长数字而放宽的边界:
- 限制级记录保留在完整静态索引中,分级不会触发物理删除;
- canonical URL 重复是需要诊断的问题,不是允许静默丢弃来源记录的理由;
- 医疗、法律、兵役、服务、活动和政策页面必须保留发布者与日期边界;
- 调查结果保留样本大小、招募方式和适用范围,不泛化为人口统计;
- 历史活动继续作为历史记录时,不会被写成当前报名、服务或政策机会;
- 第三方作品、论文、影片、新闻、个人叙事和活动正文不会因为索引接入而被复制;
- 来源暂时离线、维护或迁移时,优先更新状态和 provenance,而不是删除已有有效记录。
本周没有为了来源增长而降低 restricted count,也没有以重分类或删除旧记录制造净增长。
搜索与发布健康
生产搜索仍是浏览器端静态搜索:页面先读取 manifest,再按查询需要加载内容寻址的文档分片与 inverted posting buckets。旧的服务器搜索端点已经退休,生产上继续以静态搜索为唯一搜索路径;退休端点不作为静态搜索的后备 API。
每次搜索面对的来源变更都必须通过源记录计数、完整语料、来源 profile、固定查询、静态构建、canonical/robots/sitemap、限制级保存和生产域名验收。gh-pages 仅作为与 Cloudflare Pages 同一来源构建的静态镜像交叉验证,不是独立的第二套生产语料。
分析数据能说明什么,不能说明什么
索引 manifest 可以证明记录数、来源数、限制级分级和重复 URL 诊断;它不能证明搜索流量、点击率或排名提高。当前仓库仍没有可用于本次发布结论的 finalized GA4 / Google Search Console 聚合导出;Cloudflare 读取连接也无法在无人值守环境中无歧义选择账户/zone,因此这里不把部署成功解释成 sessions、CTR、平均排名或转化增长。
同样,公开搜索引擎偶尔发现品牌词或页面并不等于存在经过验证的外部链接。只有实际检查第三方页面并确认它链接到 canonical TS Index 页面,才能记录为 verified external link。
下一轮优先事项
接下来的重点不是追求更大的记录数,而是继续提高可验证性与使用体验:重新核验此前暂缓且访问不稳定的大学与社区来源;扩大台湾、香港及华语离散社群的跨性别历史/文化第一方材料;为法律、兵役、医疗和服务页持续维护 freshness 边界;维护固定查询和浏览器成本基线;并在 provider 聚合数据真正可用时,把流量与搜索表现纳入这份报告。
如果某个来源失效、状态变化、metadata 有误或缺少重要 provenance,可以先查看对应来源档案的覆盖说明,再通过项目维护渠道提交可复现的更正线索。
2026-09-14:75 个来源域名,39,435 条可搜索记录
2026-09-14 的完整静态索引包含 39,435 条来源记录和 39,435 条可搜索记录,覆盖 75 个来源域名。其中 27,052 条带有限制级分级,重复 canonical URL 诊断为 0。
与 2026-09-07 的 39,416 条记录、59 个域名相比,该周净增加 19 条可搜索记录和 16 个来源域名。新增来源主要来自经过逐页审查的小型机构、大学、媒体、人权与公共记录来源,而不是扩大大型文学/镜像档案。
当周新增重点包括香港教育大学 Research Repository、臺大《女學學誌》、政大《台灣文學學報》、文化大学机构典藏、东海大学高教深耕、香港中文大学 Research Portal 与 Gender Research Centre、中央大学 IACS-UST、公视、司法改革基金会、妇女新知基金会及马祖地方公共记录。研究样本、地方调查和旧法律争议都保留各自范围边界。
2026-09-07:59 个来源域名,39,416 条可搜索记录
2026-09-07 的静态索引包含 39,416 条来源记录和 39,416 条可搜索记录,覆盖 59 个来源域名。其中 27,052 条带有限制级分级,重复 canonical URL 诊断为 0。
与 2026-08-31 的 39,364 条记录、39 个域名相比,该周净增加 52 条可搜索记录和 20 个来源域名。记录增长既包括新接入的精选机构页面,也包括已批准 Wiki 来源的上游 metadata 同步;不能把全部 52 条都解释为“20 个新网站各新增一页”。
当周新增重点包括数字典藏/文化保存、大学与研究机构、人权与公共记录,以及香港社群公共教育;这些来源的详细边界已保留在各自来源档案与历史发布记录中。