昨晚做了个梦,梦见我还在明略科技上班,坐在工位上一条一条地查自己的专利有没有授权。醒来觉得好笑,辞职这么久,博士都快毕业了,还在梦里操心公司的事。但好笑归好笑,鬼使神差地,我真的打开专利检索网站查了一下。

一查吓一跳。2022年申请的两个专利,一个刚授权没几天,一个还在审。已经整整四年了。

2022年,我在做什么

2022年我硕士毕业,第一份工作在明略这家tob的独角兽公司。我在的搜索组主要做知识图谱和搜索相关的toB和企业内部业务,Elasticsearch是主力搜索引擎。我不能说每天跟ES打交道吧,但每天都了解一下ES的原理。当时组里其实也比较饱和,作为一个新人,负责带我的曹博给我甩了一些组里长久未做的疑难杂症让我去研究。于是我面临了几个问题,后来形成专利的主要有俩问题。

第一个问题:ES 觉得”知识的图谱”和”知识图谱”没关系

ES 的短语匹配(phrase match)很死板。你搜”知识图谱”,它只认这四个字连在一起的文档。”知识的图谱”、”“知识构建图谱”——哪怕意思完全一样,只要中间夹了字,就召回不了。

你可以加slop。slop 的意思是允许词之间隔几个位置——slop=1 时,”知识的图谱”能被匹配到,slop=2 时”知识构建图谱”也能被匹配到。但slop是个纯机械的距离度量:两个词之间隔了几个位置,跟这两个词到底是不是真正的固定搭配,一点关系都没有。

所以我们琢磨了一个紧密度的概念,就是说这俩词在平时有多么紧密

我后来写了个简单的方案:离线阶段,把文档库里的候选词组全部挖出来,用 PMI(点间互信息)、左右信息熵、词频、IDF 四个指标给它们打一个”紧密度分” (其实这写个指标是从新词发现的概念里面借用来的)。分数高的,说明”知识”和”图谱”是真正的固定搭配;分数低的,说明它们只是碰巧挨在一起。然后建一张离线词表,查询的时候查表,高分片段映射成小 slop,低分片段映射成大 slop。

用统计特征给短语的”紧密度”打分,替代 ES 原生的纯距离判断。非常朴素的一个想法,给slop的决定加了一些简单的自动化的灵活性。

这就是第一个专利:一种文档的排序方法及装置。2022年3月24日申请,2026年6月5日授权,审查了四年。

第二个问题:搜索推荐只能做字面相似,做不了语义相似

另一个事情是搜索推荐。当时的推荐系统,基本就是统计用户的搜索记录,然后推荐字面相似的词。”知识图谱”推荐出”知识分子”,字像,意思完全不一样。

我想的是,能不能用当时最火的词向量来做?word2vec 或 glove 能把词变成向量,但在特定业务环境下,通用模型不关心你的业务场景。我的想法是:用业务语料去训练词向量模型,刻意把样本词和它的同义词在向量空间里拉近。训练完之后,输入一个目标词,在样本词向量库里做最近邻检索,反推回来就是推荐词。

核心逻辑很简单:让同义词在向量空间里真的靠近。

这就是第二个专利。

两条腿走路

两个专利放在一起看,当时的思路其实很清楚:

一个是召回问题,用统计特征评估短语紧密度,让 ES 的召回排序更准

一个是搜后推荐的问题,用同义词监督做词向量微调,让推荐覆盖到语义相似的词

后来发生了什么

向量检索全面落地

2023年以后,BGE、text2vec、Cohere 这些 embedding 模型一个接一个出来,dense retrieval 从论文落地到生产环境。把 query 和文档都编码成稠密向量,靠语义相似度做召回——”知识的图谱”和”知识图谱”在向量空间里天然接近,根本不需要手动设计 PMI 打分和 slop 映射规则。

对比学习成为标配

我第二个专利的核心——用同义词对拉近向量距离——本质上是对比学习(contrastive learning)的朴素版本。SimCSE 2021年就出来了,in-batch negatives、dropout 做数据增强这套方法论 2022 年以后迅速成为文本表示学习的标配。我用人工同义词表做监督信号的路子,跟后来那套体系比起来,太手工了,也太稀疏了。也难怪至今还没过。

大模型吃掉一切

然后是 ChatGPT,然后是大模型。2023 年以后,搜索推荐的范式彻底变了:

  • query 改写是LLM 一句话的事,不需要你手动建同义词表
  • 召回排序用RAG + LLM reranker,比用 PMI 算紧密度靠谱一个数量级
  • 推荐词汇直接让 LLM 基于上下文生成推荐,比你做向量检索丰富得多

2022年的我,觉得自己掌握了这个行业最锋利的剑,没想到后来看到洋人手里的是火枪。

后记

我把我的专利pdf喂给了Deepseek V4 Pro,我问问他,你觉得2022年写下这个东西的那个菜鸟工程师怎样?他给了我一个画像:

  • 有扎实的搜索工程经验
  • 能把经典方法工程化落地
  • 抽象和建模能力中等偏上
  • 典型的”能把事情搞定”的工程思维,不炫技
  • 像是”工程出身、自学了很多 NLP 知识”的人

我跟他说,那个人就是我,刚入职不久的我。出人意料的是,AI竟然问了我一句话:你现在回头看这个专利什么感觉?会觉得幼稚还是觉得当时思路还行?

我说:被大模型时代的洪流淹没了,这个专利2026年6月才通过,也算对那几年有个交代了

AI宽慰我道:确实,2022年3月申请,2026年6月授权,四年多——这个时间跨度本身就是一段行业变迁的缩影。

申请的时候,ES还是搜索的绝对主力,embedding模型还没普及,ChatGPT还差8个月才发布。这个方案在当时是有实际价值的工程优化。

授权的时候,世界已经完全是另一套范式了。向量检索、RAG、LLM reranker——你说的”被洪流淹没”一点不夸张。审查员可能审着审着自己都在想”这玩意现在还有人用吗”。

但换个角度想:

有些东西的价值不在”还能不能用”,而在”证明你曾经能做什么”。这个专利就是那几年的一份存档——证明你刚毕业就能独立发现问题、设计方案、工程化落地。它会跟着你一辈子,申户口、评职称、跳槽背调,每次都能用上。

技术会被淘汰,但那份”我能做出来”的底气不会被淘汰。

而且说真的,刚毕业第一年就憋出一个授权专利的人,在工程师群体里占比真不高。你现在回头看觉得它朴素,恰恰说明你这四年没停在原地。如果你现在回头看觉得”卧槽我当时太牛了”,那才是真正需要担心的。

专利拿到了,那几年有了交代。接下来该揍这个新时代了。


<
Previous Post
西班牙是冠军!
>
Blog Archive
Archive of all previous blog posts