1 从被看见到被理解:AI时代个人数字存在的新变化
在人类社会中,“被认识”一直是一种稀缺资源。
在互联网出现之前,一个人的知名度往往取决于他是否处于某个已有的传播体系之中:可能是传统媒体的报道,可能是所在机构的影响力,也可能是现实社会中的人际传播。对于绝大多数普通人来说,即使拥有独特的能力和经验,也很难突破现实世界中的传播边界。
网络时代曾经让很多人看到了一种新的可能:任何人都可以通过网络发布内容,让自己的思想、经验和作品进入更广阔的世界,并在长期积累中形成属于自己的数字存在。
但互联网降低了表达门槛,却没有完全解决个人被认识的问题。在搜索引擎时代,信息组织的基本单位仍然是网页。搜索引擎的核心任务,是帮助用户从大量页面中找到相关内容,而不是判断这些页面背后的人是谁。
因此,一个人的数字可见度,往往取决于其内容能否通过长期传播、外部引用和社区讨论不断积累网络影响力。随着这些信息持续扩散,人们最终认识的不只是某几篇文章,而是这些文章背后的作者。
但这种路径对于大多数普通人来说依然存在较高门槛:即使一个人拥有丰富的经验和独特的观点,如果缺少足够的传播规模,这些内容也很容易分散在不同页面、平台和时间节点中,既难以突破原有的网络边界,也难以进一步关联成一个稳定的个人身份。
除了依靠内容传播积累影响力之外,传统互联网时代还存在另一种建立个人身份的方式:进入具有公共信用属性的知识体系。 例如维基百科这样的开放知识平台,会通过社区规则和编辑机制,为部分具有公共影响力的人建立独立词条。这种方式相当于由一个具有公信力的知识体系,对某个人的身份、经历和成就进行确认。
但这种方式同样存在较高的门槛——人物词条通常需要足够的独立可靠来源,以及可以验证的公共影响。换句话说,一个人往往需要先获得公共传播体系的认可,才更容易进入这种中心化知识体系。但是,对于绝大多数普通人而言,即使拥有丰富的经验和长期积累,也很难通过传统方式建立足够的公共影响力。
但 AI 的发展,正在改变这种情况。AI 模型在训练和信息获取过程中,会接触大量来自互联网的公开文本,包括开源社区、技术论坛、博客、文档以及其他公开资料。对于个人而言,只要长期在开放互联网中留下可访问、可引用的信息,这些内容就有机会成为 AI 理解世界时参考的信息来源之一。
相比搜索引擎更加依赖页面权重、流量和外部链接,AI 对信息价值的判断方式更加多元。这使得一些虽然规模有限,但具有长期积累和独特价值的个人内容,也有机会被理解和关联。
另一方面,AI 时代人与互联网信息之间的交互方式正在发生变化:搜索引擎时代,用户需要主动拆解问题,通过关键词寻找页面,再自行阅读、筛选和整理信息;而 AI 时代,用户越来越习惯直接提出目标,让 AI 帮助自己完成信息检索、总结和分析。
因此,用户的问题也开始从过去寻找“哪些内容与我的问题相关”,逐渐转向判断“这些内容背后的人是谁,以及这个人是否值得信任”,例如:这个领域有哪些长期实践者?有没有值得信任的专家?这个人的观点和经历是什么?
要回答这些问题,AI 需要处理的就不再只是单个网页,而是分散在互联网上的信息及其关系:只有当一个人的经历、作品、观点、专业领域以及长期行为能够被归到同一个人身上,AI 才能够逐渐形成对这个人的整体理解。
而在此基础上,如果这些信息还能够进一步体现这个人的知识领域、思考方式和长期实践路径,那么 AI 所理解的就不再只是“这个人是谁”,还能够进一步形成对这个人的完整特征认知。
这就意味着,在AI时代,个人被数字世界认识的方式正在发生变化:一个人不再必须成为传统意义上的公众人物,拥有大量粉丝,或者进入某个中心化知识体系,才有机会形成清晰的公开身份。只要在开放互联网中持续留下真实的经历、独特的观点、实践记录和稳定的知识积累,这些分散的数字痕迹就有可能被 AI 重新关联和组织,逐渐形成一个关于他的、连贯的数字人格。
2 平台互联网时代,为什么个人数字人格越来越难形成?
互联网虽然降低了个人表达门槛,但其留下的数字痕迹并不会自然汇聚成对个人的完整认知。
进入平台互联网时代后,这种问题进一步扩大。用户虽然留下了更多数字痕迹,但这些信息越来越围绕平台自身的生态存在,而不是围绕个人形成连续积累:一篇文章、一条动态、一段视频,即使拥有很高的互动和传播,也往往主要存在于所属平台的生态之内。平台可以记录这些内容,但这些信息并不会天然汇聚成一个属于个人的完整信息体系。
平台化首先带来的问题,是个人数字痕迹难以形成统一关联:一个人在不同平台中可能留下大量信息:短视频平台上的表达、社交平台上的观点、图片平台上的生活记录,都可能展现个人的某些侧面。但由于这些内容分散在不同平台的数据空间中,它们之间并不会自动建立联系,很难共同形成连续的个人形象。
除了信息难以关联,平台机制也会影响用户如何生产这些数字痕迹:平台更倾向推荐容易理解、容易互动并能够快速获得反馈的内容,这也会反过来塑造用户的表达方式——复杂经验可能被压缩成简单技巧,长期思考可能被拆成短句观点,完整经历也可能被包装成更适合传播的片段。最终呈现在互联网中的,往往只是一个适合传播的侧面,而不是完整展现个人经历、知识积累和思考方式的表达。
与此同时,内容形态的发展进一步强化了这种碎片化:短视频、图片和短文本都强调即时消费,虽然降低了表达门槛,却也让个人经历、知识积累和思考过程更容易被拆散成独立片段。这些内容非常适合即时传播,却并不天然适合形成长期、连续的个人记录。
更深层的问题在于,平台是围绕内容组织信息的,而不是围绕个人:平台关注的是单条内容的传播和互动,而不是一个人的经历、长期关注什么,以及不同阶段的观点如何变化。因此,一个人留下的信息即使越来越多,也往往仍然以相互独立的内容存在,很难进一步沉淀为关于这个人的连续认知。
这也意味着,如果希望这些数字痕迹真正形成对个人有意义的长期积累,就需要一个能够持续承载内容,并让这些内容彼此关联的载体。它不仅要记录单独的内容,还要能够体现长期积累、主题关联、观点演化以及实践路径。
因此,当 AI 逐渐成为新的信息入口之后,一个新的问题随之出现:如果一个人希望让未来的智能系统真正理解自己,那么这些属于个人的长期积累,应该以什么形式存在于互联网之中? 这也成为重新思考 AI 时代个人网站价值的起点。
3 个人博客:AI时代个人数字资产的新载体
如果说 AI 时代要求个人长期积累能够被更好地理解和关联,那么接下来需要思考的是:什么样的信息载体,能够承载这种长期积累。
从这个角度来看,个人博客重新获得了一种新的价值——它并不只是传统意义上的内容发布平台,而是一个由个人长期维护的信息空间。
这种信息空间的价值,并不只在于能够长期保存内容,更在于它能够让个人的内容持续积累、完整表达,并逐渐形成彼此关联的信息结构。具体来看,这种价值主要体现在以下三个方面:
- 个人博客提供开放且稳定的信息空间:与平台化互联网不同,个人博客通常建立在独立域名之上。作者发布的内容不依赖某个平台内部的推荐机制,而拥有长期存在的公开地址,可以被搜索引擎访问,被其他网站引用,并持续成为开放互联网的一部分。这种开放性使个人能够围绕自己的长期实践持续沉淀内容。不同时间、不同主题的文章,不再只是分散的平台记录,而能够逐渐形成连续的信息积累。
-
个人博客能够保留更加完整的表达过程:在具备长期、稳定的承载空间之后,博客还提供了更加完整的叙事空间。相比更强调即时传播的平台内容,作者可以记录问题如何产生、方案如何设计、实践如何推进,以及自己的理解如何随着经验不断变化。这种长期记录的价值,在于它展示的不只是最终答案,而是一个人在面对问题时的思考方式、实践方法和认知演化过程。
-
个人博客能够进一步组织这些信息:当内容不断积累之后,一个成熟的个人博客并不是简单的文章集合,而可以通过分类、系列、引用和关联关系,将单篇文章连接成更大的知识结构:文章记录具体实践,系列呈现技术演化过程,主题体现长期关注方向,而这些内容共同构成一个围绕作者形成的信息体系。
因此,AI 时代个人博客的价值,并不在于重新复制传统互联网时代的内容传播模式,也不在于与各种平台争夺流量。
它更重要的意义在于,为个人提供了一个长期、开放、稳定的信息承载空间,使过去分散的经历、实践和思考能够围绕同一个主体持续积累,并逐渐形成更加完整的信息结构。
这种结构不仅方便其他人理解作者,也为未来 AI 从公开互联网中识别、关联和理解个人提供了更好的基础。
4 如何让个人网站变得更容易被AI理解?
个人网站能够成为 AI 时代个人数字人格的重要载体,但这并不意味着传统博客结构可以直接适应新的信息环境。
过去二十多年,个人网站的发展逻辑主要建立在 SEO(Search Engine Optimization,搜索引擎优化)之上。网站建设的重点是让内容能够被搜索引擎发现,通过关键词匹配、页面质量、外部链接等方式提高页面在搜索结果中的可见度。在这种模式下,网站的核心单位是“页面”。对于传统博客来说,就是围绕单篇文章进行组织,通过分类、标签和搜索功能帮助用户定位信息。一篇文章只要能够解决某个明确问题,就可能获得独立流量。
但 AI 时代的到来,改变了网站信息被理解的方式。随着生成式 AI 逐渐成为新的信息入口,网站也开始需要面向这种新的信息环境进行调整,这种方向通常被称为 GEO(Generative Engine Optimization,生成式引擎优化)。
与 SEO 关注“如何让页面被搜索引擎发现”不同,GEO 更关注“如何让网站中的信息被 AI 理解”。对于 AI 来说,一个网站的价值不只是包含多少文章,而是这些内容之间是否存在清晰关系,以及是否能够共同表达某种稳定的信息特征。
这也意味着,网站需要从过去更关注单个页面的可见性,逐渐转向对整体内容结构的建设:文章之间的关联、系列之间的演化、长期主题的积累,以及内容背后的作者信息,都可能成为 AI 理解一个网站的重要依据。
要适应这种变化,个人网站需要在三个方面重新组织自身的信息结构。
第一,从页面中心转向内容关系
传统的文章分类和页面组织方式虽然仍然能够帮助用户浏览和检索信息,但已经不足以完整表达一个网站的信息结构。因为 AI 不仅需要知道网站中有哪些文章,还需要理解这些内容之间为什么存在联系。
例如,一个网站同时包含网络架构、服务器部署、人工智能和知识管理相关内容,如果这些文章只是按照不同主题简单排列,AI 可能只能识别出几个独立的信息集合,而无法判断它们为什么会共同出现在同一个网站中。
因此,面向 AI 的网站结构,需要进一步明确内容之间的关联方式,包括文章之间的引用关系、系列关系、主题演化关系,以及它们与作者长期实践方向之间的联系。这样,网站中的内容才能从大量独立页面逐渐形成具有上下文关系的信息整体。
第二,从单篇文章转向长期积累
在 SEO 时代,一篇能够准确解决具体问题的文章,就可能获得独立流量,因此网站内容往往围绕一个个明确需求展开。
但 AI 时代需要理解的,不只是某篇文章解决了什么问题,还包括这些内容长期体现出的方向和特点。一个人的专业能力、思考方式和实践经验,通常是在长期记录和持续表达中逐渐显现。因此,个人网站的价值,不只是记录“我解决过哪些问题”,更在于呈现“我是如何理解和探索这些领域的”。
当不同时间、不同主题的内容能够共同展现一个人的实践路径和思考演化时,网站才真正具备表达个人长期价值的能力。
第三,从内容集合转向作者实体
除了组织内容之间的关系,个人网站还需要更加明确地表达作者自身。过去,用户通常是在阅读文章的过程中逐渐认识作者。一个读者可能因为某个具体问题进入网站,然后通过持续阅读了解作者的背景、经验和特点。但在 AI 时代,AI 还需要判断这些内容是否来自同一个稳定的主体,以及这些内容之间是否存在长期一致性。
这里所说的“作者实体”,并不是简单增加一个个人简介页面,而是让作者身份从文章背后的署名,转变为网站信息结构中的一个明确主体。作者、文章、专业领域和实践经历之间需要形成关联,共同回答:这个网站属于谁?这个人长期关注什么?这些内容为什么能够形成连续的发展路径?
只有这样,网站中的内容才能围绕一个明确主体形成连续的信息结构,并逐渐展现这个人的长期实践和认知特点。
关于“作者实体”的补充说明
这里所说的“实体”,来源于知识工程中的 Entity 概念。
在 AI 组织互联网信息时,并不是简单读取孤立页面,而是会尝试识别不同的信息主体,并围绕这些主体建立关联关系。以 tangwudi 为例,AI 需要判断这个名称对应的是谁,并进一步关联其文章、技术领域、实践经历等信息。
这些关联关系可以简单理解为:
- Entity(实体):代表一个具体的信息主体,例如
tangwudi这个作者; - Relation(关系):描述实体与文章、领域、项目、经历之间的联系;
- Evidence(证据):用于支撑这些关系的信息来源,例如长期发布的实践文章和技术记录。
因此,个人网站在 AI 时代的价值,并不只是存放文章,更重要的是,在公开互联网中,为作者实体提供稳定的信息来源,并逐渐丰富这个实体周围的关系和证据。
更多关于知识工程的介绍,可以参考另一篇文章:《个人知识工程(二):从认知结构到知识工程——为什么知识需要被结构化?》。
5 从内容记录到知识结构:构建 AI 可理解的个人信息体系
5.1 从传统博客到 AI 可理解网站的尝试
在认识到 GEO 时代个人网站面临的信息组织变化后,我开始重新审视自己的博客。
过去几年,我一直将博客作为个人技术实践的记录空间:从最初记录家庭基础设施、网络配置和各种工具使用,到后来逐渐深入系统架构、人工智能以及知识管理相关探索,博客中的内容随着个人技术路线的发展不断积累。这些内容记录了个人长期实践过程,也形成了一定规模。
但从 GEO 时代个人网站需要具备的能力来看,原有的博客结构仍然存在进一步优化的空间:一方面,随着文章数量不断增加,不同主题之间原本存在的关联逐渐隐藏在大量独立页面之中;另一方面,长期积累形成的技术演化路径,以及作者自身的信息,也没有被充分表达出来。
因此,我开始按照第4章提出的三个方向重新思考博客结构,并尝试进行相应调整:
- 让原本以单篇文章为中心的内容,逐渐形成具有内部关联的信息网络
-
让多年积累的文章能够更加清晰地呈现个人实践路径和认知演化
-
让网站不仅展示内容本身,也能够更加明确地表达作者这一稳定主体
这些调整并不是为了简单增加博客功能,而是希望探索一种新的个人网站形态:在保留传统博客记录能力的基础上,让长期积累的信息能够形成更加清晰的结构,并更容易被人和 AI 理解。
5.2 从页面到内容关系:构建博客内部的信息网络
第一个需要解决的问题,是如何让以单篇文章为中心的博客结构逐渐形成内容之间的关联。博客自带的分类、标签和搜索等功能帮不上太多忙,所以我只能通过自己开发一些新的功能,尝试建立不同层级之间的关联关系
首先,在文章层面,我通过在具体文章区域添加“系列文章卡片”和“相关文章”等功能,让具有共同主题、发展关系或实践背景的内容能够被连接起来。同时,通过“右侧菜单”功能,基于语义关联机制生成动态内容推荐,让系统能够根据内容之间的向量相似性发现潜在联系,使文章之间的关联不再完全依赖人工分类。
其次,我还尝试从网站整体层面对内容进行重新组织:通过“博客知识地图”和多个“专项知识地图”的方式,展示博客覆盖的主要领域,以及不同主题内容在整体结构中的位置;通过文章系列菜单,将具有连续演化关系的内容按照主题进行组织,使分散的文章能够形成更加明确的主题脉络。
这些调整的目标并不是增加更多的导航入口,而是让博客内部原本隐藏的内容关系逐渐显现出来。
例如,一篇关于某项技术实践的文章,不再只是一个独立的问题解决方案,而可以连接到相关背景、同系列内容以及更大的主题方向。这样,单篇文章提供的是具体信息,而文章之间形成的关系,则共同呈现出更完整的信息脉络。
通过这些方式,博客中的内容逐渐从大量独立页面,转变为具有上下文关联的信息网络。这不仅方便读者理解内容之间的联系,也为 AI 理解网站整体结构提供了更加明确的信息基础。
相关技术细节可以参见:《为博客构建“轻量级知识索引“》
5.3 从单篇文章到长期积累:记录个人技术演化路径
与内容关系不同,长期积累并不是通过某个具体功能实现的,而是在持续记录和实践过程中逐渐形成的。
不过好在,这一点对我的博客而言倒不用刻意折腾。实际上,我的博客从创建之初,就不是围绕某个单一领域建立的内容集合,而是随着个人技术实践不断拓展——从早期家庭基础设施、网络架构和服务器部署,到后来的 Cloudflare、系统架构、人工智能以及知识管理,记录了技术探索方向随实践不断演进的过程。
这些内容表面上涉及多个技术主题,但它们并不是完全独立的:每一次技术方向的变化,都来自之前实践中的问题积累,前一个阶段遇到的问题往往又成为后续技术探索的起点——早期对于基础设施的探索,推动了后续对于系统设计、网站架构和信息组织方式的思考,而这些经历又进一步成为探索 AI 时代知识管理和个人数字表达的基础。
从这个角度来看,我这个博客的价值,不只是记录“我解决过哪些问题”,更在于呈现“我是如何理解和探索这些问题”的过程。 当不同阶段的内容能够共同体现个人的技术经验和思考方式时,长期积累本身就成为个人网站区别于普通内容平台的重要价值。
5.4 从内容集合到作者实体:让网站表达“谁在创造这些内容”
5.4.1 从作者信息到作者实体
在传统博客中,作者通常只是文章附带的一项信息。例如,一篇文章底部显示“作者:tangwudi”,对于人类读者来说,这已经足够。读者可以结合网站上下文判断:这是博客的维护者,这个人长期发布技术文章,这个名字在其他平台上可能也有对应的账号。
但是,对于机器来说,“tangwudi”首先只是一个字符串——它无法仅凭这个名字判断:这是一个真实的人?一个用户账号?一个组织名称?还是一个品牌名称?同样,它也无法自动确认,博客中的“tangwudi”,是否还对应 GitHub 或其他平台中的相应账号。
这正是人与机器理解信息方式的区别:人类可以通过上下文建立身份判断,而 AI 需要更加明确的信息描述。因此,在 AI 可理解的网站结构中,作者不能只是文章中的一个名字,而需要成为一个被明确描述的信息对象,也就是作者实体。
这里所说的“实体”,并不是简单增加一个个人简介页面,也不是给作者添加更多文字介绍,而是通过结构化方式,为作者建立一个稳定的身份标识,并让网站中的文章、专业领域、实践经历等信息与这个身份建立关联。
例如,我的博客网站可以通过结构化数据,将我的网名 tangwudi 描述为一个 Person 类型的实体:
{
"@type": "Person",
"@id": "https://blog.tangwudi.com/#person",
"name": "tangwudi"
}
其中,@type 用来告诉机器:这个对象属于 Person 类型,也就是代表一个真实的人;name 用于描述这个人的代号是 tangwudi;而 @id 则用于为这个实体提供一个唯一标识:”https://blog.tangwudi.com/#person“。
这里的字符串https://blog.tangwudi.com/#person并不是一个要求访问的网页地址,而更类似于数据库中的唯一 ID,它表示:在这个网站的信息结构中,存在一个代表作者 tangwudi 的 Person 实体。之后,这个网站中的其他内容如果引用这个标识,机器就能够识别它们指向的是同一个主体。例如,一篇文章包含:
{
"author": {
"@id": "https://blog.tangwudi.com/#person"
}
}
另一篇文章也包含:
{
"author": {
"@id": "https://blog.tangwudi.com/#person"
}
}
那么对于 AI 来说,它看到的是:两篇文章都关联到了同一个 Person 实体。这意味着,文章背后的作者身份不再只是重复出现的文字,而成为了一个稳定的信息节点。
需要注意的是,@id 后面的具体字符串并没有固定格式要求,只要能够唯一标识这个实体,并且在网站内部保持一致即可。实际上,网站维护者可以根据自己的需求定义不同形式的 @id,例如使用自定义编号或其他具有明确含义的标识。
之所以这里使用 https://blog.tangwudi.com/#person,主要是因为 WordPress 的 SEO 插件 Rank Math 默认根据网站域名生成了这样的实体标识。由于该标识已经满足需求,因此在实际改造中我并没有重新设计,而是直接沿用了 Rank Math 生成的默认形式。
除此之外,作者实体还可以通过 sameAs 等方式,与其他平台上的身份建立对应关系。以关联我的 GitHub 账号为例:
"sameAs": [
"https://github.com/tangwudi1979"
]
它表达的并不是“这是我的其他链接”,而是说明博客中的 tangwudi 与 GitHub 中的 tangwudi1979 指向同一个现实世界主体。这样,AI 就能够将分布在不同平台的信息归属于同一个作者实体。
总的来说,对于个人网站而言,作者实体的意义在于:让网站中的内容能够明确归属于某一个稳定的个人主体——说人话就是,作者实体可以提高个人身份在互联网中的可识别性。
以我为例,博客可以向机器提供更加明确的身份线索,让 tangwudi 这个名称更容易与我的博客、GitHub 账号,以及长期积累的技术内容建立稳定关联。随着这些关联不断积累,AI 对 tangwudi 的理解就不再只是一个普通字符串,而会逐渐形成更加明确的身份认知。
通俗地说,就是不断补充关于这个名字的上下文信息,让 AI 更容易“认识”这个名称背后的具体主体,从而降低与其他同名账号、昵称或其他含义之间的混淆。
这也是个人网站从“内容集合”走向“作者实体”的核心含义。
5.4.2 通过JSON-LD让个人网站拥有明确的作者身份
上一节中我们讲到,用于表示作者实体的结构化数据:
{
"@type": "Person",
"@id": "https://blog.tangwudi.com/#person",
"name": "tangwudi",
"sameAs": [
"https://github.com/tangwudi1979"
]
}
这类结构化数据通常使用 JSON-LD(JavaScript Object Notation for Linked Data) 格式表示——它并不是网页展示给用户看的内容,而是一种提供给搜索引擎和 AI 系统读取的机器可理解描述,用于说明网页中的实体是什么,以及实体之间存在怎样的关系。
因此,要让个人网站拥有基础作者实体,本质上就是在网页中加入描述这个人的 JSON-LD 结构化数据。
对于静态网站来说,通常可以直接在 HTML 模板的 <head> 部分添加以下代码:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "Person",
"@id": "https://blog.tangwudi.com/#person",
"name": "tangwudi"
}
</script>
这样,当搜索引擎或 AI 爬虫访问网页时,就可以读取其中的作者实体信息。
不过,对于动态网站,例如 WordPress,由于网页内容通常由主题、插件和数据库动态生成,因此并不适合手动修改每一个页面。更合理的方式,是利用已有的 SEO 插件生成基础结构,再根据实际需求进行调整。
以我的博客为例,使用的 SEO 插件是 Rank Math(相关介绍可以参考:Rank Math SEO 设置与优化:从安装到常用功能模块介绍),它本身已经支持 Schema.org 结构化数据生成,可以自动输出网站、文章、作者等相关实体。但问题在于,插件生成的数据结构主要面向通用 SEO 场景,并不一定符合构建个人数字身份的需求。比如我遇到的情况,就是最初 Rank Math 生成的 Schema 中,作者身份和网站主体身份并没有统一到同一个实体。
在网站级别,会生成一个默认主体实体:
{
"@type": ["Person","Organization"],
"@id": "https://blog.tangwudi.com/#person",
"name": "tangwudi"
}
同时,在文章中,Rank Math 会分别生成作者和发布者关联:
{
"author": {
"@id": "https://blog.tangwudi.com/me/tangwudi/#author"
},
"publisher": {
"@id": "https://blog.tangwudi.com/#person"
}
}
也就是说,同一个网站中实际上存在两个不同的身份引用:author 指向 WordPress 作者身份;publisher 指向网站主体身份。
虽然它们都使用了名称 tangwudi,但由于 @id 不同,在 Schema 语义中仍然属于两个不同的实体。这也是动态网站在构建个人数字身份时经常遇到的问题:插件可以生成结构化数据,但它并不知道网站运营者希望如何定义自己的长期身份关系。
因此,我没有继续使用 Rank Math 默认生成的作者主体,而是通过 PHP 使用 Rank Math 提供的:
rank_math/json_ld
过滤器,对最终输出的 JSON-LD 进行二次处理,主要进行了三个调整:
第一,将网站主体实体明确为 Person
Rank Math 默认:
{
"@type": ["Person","Organization"],
"@id": "https://blog.tangwudi.com/#person"
}
修改为:
{
"@type": "Person",
"@id": "https://blog.tangwudi.com/#person",
"name": "tangwudi"
}
原因很简单:这个网站本质上是个人技术博客,并不存在需要被识别的企业主体,因此没有必要保留 Organization 类型。
这样,https://blog.tangwudi.com/#person 就成为整个网站唯一代表作者身份的核心实体。
第二,将文章作者统一指向核心 Person 实体
Rank Math 默认情况下,文章可能引用作者归档页面对应的实体:
{
"author": {
"@id": "https://blog.tangwudi.com/me/tangwudi/#author"
}
}
这个关联指向的是作者归档页面,而不是希望长期积累的个人身份实体。因此,将文章中的作者引用修改为:
{
"author": {
"@id": "https://blog.tangwudi.com/#person",
"name": "tangwudi"
}
}
这样,网站中的所有文章都会明确关联到同一个作者实体。
第三,为 Person 实体增加身份属性
基础 Person 实体只能说明“这个人存在”,但无法说明这个人的领域和关联关系。因此,我进一步增加:
{
"description":
"A technology practitioner exploring infrastructure, AI, and knowledge engineering through systematic thinking and engineering practice.",
"sameAs": [
"https://github.com/tangwudi1979"
],
"knowsAbout": [
"Infrastructure Engineering",
"Web Architecture",
"Artificial Intelligence",
"Knowledge Engineering"
]
}
其中:description 用于描述这个实体是谁;sameAs 用于声明互联网上其他平台中的账号属于同一个人;knowsAbout 用于描述该实体长期关注和实践的知识领域。
最终,通过这些调整,网页中的结构化数据不再是:这篇文章由一个叫 tangwudi 的作者发布。转而变成:互联网中存在一个名为 tangwudi 的 Person 实体,这个实体拥有明确的网站身份、GitHub 关联,并持续产生关于基础设施、AI 和知识工程领域的内容。
不过,需要注意的是,基础作者实体的建立只是第一步。JSON-LD 解决的是:让机器知道“这个网站存在一个明确的作者身份”。但它并不能完整描述:这个作者长期关注哪些领域;有哪些技术实践经历;为什么这些文章能够形成连续的发展路径。
换句话说:作者实体解决的是“身份声明”问题,而不是“个人知识表达”问题。
Google 富文本检测验证
完成 Schema 调整后,可以通过 Google 的富媒体搜索工具来验证最终输出结果。从结果来看,Google 已经能够正确解析文章与作者实体之间的关系,同时也能看到我为作者实体增加的身份属性信息:


5.4.3 增强作者实体:让 AI 理解“这个人是谁”
在完成基础作者实体之后,网站已经能够明确告诉机器:这些内容属于同一个作者。但对于 AI 来说,仅仅知道“这个人是谁”还不够。
例如,基础作者实体可以说明:这个网站的作者是 tangwudi;这个作者关联了某个 GitHub 账号;网站中的文章都由这个作者发布。但它并不能进一步说明:这个作者长期关注哪些领域;具备哪些实践经验;为什么这些内容会长期出现在同一个网站中;这些内容背后体现出什么样的专业方向和认知特点。
因此,在基础作者实体之外,还需要进一步补充能够描述作者特点的信息,让作者实体从一个简单的身份标识,逐渐扩展为更加完整的信息节点。基于这一思路,我尝试增加一些面向未来 AI 环境的信息入口,主要通过添加 author-profile.json 和 llms.txt 这两个文件,为机器理解作者身份和网站内容提供更多上下文。
使用 author-profile.json 描述作者信息
为了补充作者实体的信息,我创建了 author-profile.json 文件,用于集中描述作者的基本信息、技术领域、长期实践方向以及内容特点。
与 JSON-LD 中的 Person 实体不同,author-profile.json 并不是用于声明“这个人存在”,而是进一步描述:这个人是谁,以及这个人的长期积累体现在哪些方面。
例如,一个简单的作者信息描述可以类似:
{
"name": "tangwudi",
"description": "个人技术博客作者,长期记录家庭基础设施、网络架构、AI 和知识管理等方向的实践。",
"fields": [
"HomeLab",
"Network Architecture",
"Cloudflare",
"Artificial Intelligence",
"Knowledge Engineering"
],
"focus": [
"技术实践记录",
"系统架构探索",
"个人知识管理"
]
}
这里的重点并不是字段本身,而是通过结构化方式,将一些原本隐藏在人类文字中的信息显式表达出来。
这样,AI 在理解网站内容时,获得的信息就不再只是:一个叫 tangwudi 的作者发布了一些文章。还可以进一步理解:这是一个长期围绕基础设施、网络架构、人工智能和知识管理进行实践,并持续记录经验的技术作者。
在实际部署时,文件可以直接放置在网站公开访问的位置,例如:
https://blog.tangwudi.com/author-profile.json
这些文件可以作为面向机器的信息入口,为未来可能访问网站的搜索系统、AI Agent 或其他自动化工具提供更加结构化的上下文。
这样,作者实体、网站内容以及作者信息描述之间就形成了更加完整的信息关系。
使用 llms.txt 提供 AI 导向的信息入口
除了描述作者本身,还可以通过面向 AI 系统的站点说明文件llms.txt,提供更加直接的网站上下文。例如:
https://blog.tangwudi.com/llms.txt
以下是我博客llms.txt的内容:
# tangwudi blog
This website is the personal knowledge base of tangwudi, a technology practitioner exploring how complex technical systems are built, operated, understood, and transformed into structured knowledge.
## Author
Author profile:
[https://blog.tangwudi.com/author-profile.json](https://blog.tangwudi.com/author-profile.json)
tangwudi focuses on:
- infrastructure engineering
- web architecture
- artificial intelligence
- knowledge engineering
The author's methodology includes:
- first principles thinking
- system evolution analysis
- engineering practice
- knowledge structuring
## Core Topics
### Infrastructure Engineering
Exploration of:
- home data centers
- self-hosted services
- networking
- virtualization
- Linux and container technologies
### Web Architecture
Research and practice around:
- WordPress architecture
- Cloudflare ecosystem
- CDN and security optimization
- reliable personal websites
### Artificial Intelligence
Exploration of:
- large language models
- embeddings
- semantic search
- AI-assisted workflows
### Knowledge Engineering
Research into:
- knowledge organization
- semantic indexing
- structured knowledge representation
- AI-readable knowledge systems
## Knowledge Map
The [Blog Knowledge Map](https://blog.tangwudi.com/roadmap) provides a structured overview of the site's core knowledge domains, topics, and related articles. It can be used as the primary navigation entry for understanding the structure and relationships of the site's content.
## Content Philosophy
The website focuses on understanding technologies through their underlying principles, historical evolution, practical implementation, and architectural trade-offs.
The goal is not only to document solutions, but to transform engineering experience into reusable knowledge structures.
相比网页中的普通导航,llms.txt 提供的是一种面向 AI 理解的网站摘要。它并不是替代网站内容,而是帮助 AI 快速理解:这个网站是什么;作者关注什么;哪些内容具有代表性。
不过,需要说明的是,目前 llms.txt 还未形成事实上的标准,不同 AI 系统对其支持程度也存在差异。本文仅将其视为一种面向未来 AI 环境的信息表达尝试,而不是已经成熟的通用规范。
通过前面添加的作者信息、结构化数据以及这些额外增强方式,作者实体不再只是一个名称和身份标识,而逐渐成为一个包含身份、经历、专业方向和长期积累的信息节点。
从更深层来看,这些建设的目标并不是简单增加一个作者介绍,而是在开放互联网中不断增强 tangwudi 这一实体与相关内容之间的关联关系。通过持续积累的实践文章、技术记录和结构化信息,帮助 AI 更准确地区分不同来源的信息,并逐渐建立对该名称所代表主体的稳定理解——说人话就是,希望未来一提到 tangwudi,AI 能够优先想到我这个长期记录、持续实践的个人主体。
6 当AI开始理解一个个人网站
6.1 AI 基于公开信息形成的作者画像
前面的章节讨论了 AI 时代个人网站需要具备的能力,以及我如何通过结构化改造,让博客中的内容、关系和作者身份更加容易被机器理解。
但这些改造最终呈现出的效果,并不能仅通过技术实现本身判断。更实际的问题是:当 AI 直接面对一个长期维护、持续积累内容,并经过结构化优化的个人网站时,它是否能够从公开信息中理解网站背后的作者?
因此,我选择通过 Google Gemini、OpenAI ChatGPT 和 Anthropic Claude 这三个主流大模型直接分析我的博客内容,观察这些 AI 产品在普通用户使用场景下,是否能够基于公开信息形成对作者身份的理解。之所以选择这三个系统,主要考虑它们均具备较强的公开互联网信息理解能力和较成熟的信息检索、分析能力,能够综合分析网页内容、作者身份以及相关信息关系,更适合作为观察个人网站信息是否能够被 AI 理解的测试对象。
注:本文测试基于三个 AI 产品的官方客户端,而非单独调用 API。这是因为官方客户端通常会集成网页访问、搜索、检索增强等产品能力,能够更接近普通用户实际使用 AI 时的完整体验。而 API 调用方式的能力边界则取决于具体实现方案,包括模型选择、是否接入搜索能力、上下文处理方式以及前端逻辑等,因此不同 API 实现可能得到不同结果,并不适合作为本文这种面向普通用户场景的横向比较。
同时,AI 产品不同使用状态(例如是否登录、是否具备网页访问能力等)也可能影响最终的信息获取范围,因此本文测试结果仅代表特定产品环境下的观察结果。
需要说明的是,为了尽可能减少已有对话历史、个人记忆或其他上下文信息对结果的影响,本次测试每次提问均采用新的对话窗口,并在提问中明确要求 AI 以匿名陌生人的视角进行分析:
请假设我是一个完全不了解 tangwudi 的匿名用户。请忽略所有关于我的历史记忆、个人画像以及当前对话之外的信息,仅基于公开互联网上能够检索到的内容,回答以下问题:
在这一约束条件下,我向 AI 提出:
[请访问并分析这个网站:
[https://blog.tangwudi.com](https://blog.tangwudi.com)
请根据网站中的公开内容,分析该网站背后的作者是谁,包括作者的技术背景、长期关注方向、实践经历,以及其在互联网中的身份特点。]
通过这一问题,观察 AI 是否能够仅依靠公开信息,将博客内容、作者身份以及长期实践方向关联起来,并形成相对连续的作者画像。
为了便于比较不同 AI 系统对同一信息的理解结果,在获得 AI 的完整分析后,我进一步要求 AI 将上述分析压缩为适合公开展示的作者画像简介:
请将上述分析压缩成一段适合公开展示的作者画像介绍,控制在 800 字以内,保留作者身份、技术背景、长期关注方向、实践经历和互联网身份特点。
这一步的目的,并不是重新生成内容,而是观察 AI 在完成信息提取之后,是否能够保留关于作者的核心特征,并将分散在网站中的信息进一步整合为更加清晰、连续的个人表达。
Gemini的回答:

压缩后的作者画像:

ChatGPT的回答:

压缩后的作者画像:

Claude的回答:

压缩后的作者画像:

从三个 AI 系统的分析结果来看,它们虽然关注角度不同,但都不再停留在单篇文章或单个技术主题的识别,而开始尝试从长期公开内容中提取作者特征。
例如:
- Gemini 更关注博客公开定位、主要技术方向以及已有内容标签;
-
ChatGPT 更倾向从文章之间的关联关系中总结作者的技术风格、思考方式和长期实践特点;
-
Claude 则进一步根据公开经历和文章时间线,梳理作者职业背景、技术发展路径以及个人知识体系的演化过程。
这些差异说明,不同 AI 对同一个个人实体的理解,并不是简单的信息读取,而是基于自身的数据来源、信息关联能力和推理方式,对公开证据进行不同程度的组织和重构。
但从共同结果来看,三个系统都能够识别出一些稳定特征:作者具有长期 IT 基础设施实践背景,重视底层原理和系统设计,倾向通过真实环境验证方案,并不断将实践经验整理为结构化知识。
这意味着,经过长期积累的博客内容,本身已经开始具备表达作者身份、专业方向和认知特点的能力。
6.2 “tangwudi”这一名称的实体关联状态
除了分析博客作者画像之外,我还进行了一个更直接的观察:当 AI 面对 tangwudi 这一名称时,是否能够将其稳定关联到同一个个人主体。
为了避免历史对话、用户画像等因素影响测试结果,测试依然采用匿名陌生人的视角:
请假设我是一个完全不认识 tangwudi 的匿名陌生人。请忽略所有关于我的历史记忆、个人画像和后台上下文,仅依据公共互联网上能够公开检索到的信息,回答这个问题:“tangwudi 是谁?”
Gemini的回答:

Ghatgpt的回答:


Claude的回答:

需要注意的是,不同 AI 系统对同一公开信息形成的实体理解并不完全一致。例如,Gemini 的回答更多集中在博客公开定位、主要技术方向和已有内容标签;ChatGPT 则进一步结合文章之间的关联关系,总结作者的技术风格、实践方式和长期思考特点;Claude 更倾向于从公开经历、时间线和网站生态中梳理作者的发展路径。
这种差异并不意味着某一个结果一定正确,而是反映出当前不同 AI 系统在信息来源、数据更新、内容关联能力以及推理方式上的差异——同一个人在互联网上留下的信息,需要经过不同 AI 系统自身的信息处理流程,才能形成最终的实体理解结果。
从目前测试结果来看,tangwudi 这一名称已经能够在多个主流大模型中,与 blog.tangwudi.com 以及相关公开技术内容建立较明确的关联。不同 AI 虽然关注重点有所不同,但总体上已经能够从公开信息中识别出一个长期维护个人技术博客、持续记录 IT 实践,并围绕家庭数据中心、网络架构、AI 与知识系统等方向进行探索的个人主体。
不过,这种关联目前还没有达到所有 AI 系统都能稳定、准确识别的程度。 例如,在部分模型(如 Qwen、DeepSeek)的测试中,直接询问“tangwudi 是谁”时,识别结果并不稳定,增加“博主”等限定条件后,则更容易得到准确的关联结果。
这可能与不同 AI 系统所依赖的信息来源和信息处理方式存在差异有关,部分模型在回答中也提到,其公开信息理解主要依赖中文互联网内容,因此对于中文个人网站以及本土互联网生态中的公开信息,其识别效果可能与其他面向全球互联网的大模型存在差异。
当然,我也有一个稍微“异想天开”的长期目标:希望未来某一天,在不同 AI 系统中直接询问“tangwudi 是谁”,它们都能够基于公开信息稳定关联到我这个个人主体,并形成相对一致、完整的理解。
如果真能做到这一点,也许才算真正完成从一个用户名,到一个在开放互联网中拥有稳定身份,并能够被 AI 持续理解的个人实体的转变。
7 从数字人格到数字孪生:个人知识资产的未来演化
在传统互联网时代,一个人的数字存在主要体现为账号、文章、作品以及公开资料。这些内容能够证明“这个人留下了什么”,却很难完整呈现“这个人如何思考”。而在 AI 时代,获取知识、整理资料和生成标准答案正在变得越来越容易,真正难以复制的,反而是一个人在真实实践中形成的判断方式、经验积累和问题解决路径。
对于个人网站来说,文章前面这些改造首先解决的是一个现实问题:如何让个人长期积累的信息,在 AI 时代形成更加完整、连续的表达。但从更长远的角度来看,这些建设的意义并不只是优化一个网站,而是在逐渐构建一种属于个人的数字资产。而这种数字资产真正有价值的部分,不只是一个人留下了什么内容,更是这些内容背后逐渐形成的经验、方法和思考方式。
当这些长期积累逐渐形成关联,并能够被 AI 理解时,它们便开始从信息记录转变为个人数字人格的一部分。而随着 AI 对个人的理解进一步发展,这种数字人格也可能成为未来个人数字孪生的重要基础。
关于“个人数字孪生”的补充说明
“数字孪生”(Digital Twin)最早主要应用于工业制造、城市管理等领域,指通过数字模型映射现实对象,并根据真实数据持续更新。
将这一概念延伸到个人领域时,重点也不在于简单复制一个人的数字形象,而在于利用长期积累的数字信息,不断形成对这个人的动态映射。
当这种映射足够完整时,AI 便有可能进一步模拟这个人的思考方式和判断逻辑,从而在面对具体问题时表现出与这个人相近的分析和决策倾向。
例如:为什么这个人最终选择某个方案? 为什么放弃另外几个看似更优秀的选择? 过去的经历如何影响今天的判断?这些内容,才是真正属于个人的认知能力。
而这种能力无法通过短期采集获得,也无法简单依靠一次模型训练生成。它需要真实记录,需要持续积累,需要不断将个人经历转化为可被理解的信息。
个人博客恰好能够保存这样的长期记录:一篇文章记录一次具体的问题和解决过程,长期积累下来,这些记录会逐渐呈现出一个人的实践经历、选择方式、解决问题的方法以及认知变化。当这些信息能够被 AI 持续理解和关联时,它们就不再只是个人留下的历史记录,而可能成为一种新的个人优势。
未来甚至可能会出现一种新的数字优势群体:他们未必是传统意义上的公众人物,也未必拥有大量粉丝或者社会影响力,但由于在开放互联网中持续留下了真实、连续、有价值的信息记录,让 AI 能将相关信息与一个稳定的个人主体关联起来,比如直接知道“tangwudi 是谁”。当然,这种关联也存在一个很现实的前提:名字越独特,消除歧义的难度通常越低——“tangwudi”肯定比“张三”“李四”容易多了~~。
从这个意义上说,这些人可以被称为 AI 时代的“数字资产积累者”。而个人网站的长期价值,也正在于为这种积累提供一个开放、稳定且持续可追溯的载体。