2026/7/25 15:30:14

HMM(隐马尔可夫模型)用于 NER 时,其隐状态和观测状态分别对应什么?

HMM(隐马尔可夫模型)用于 NER 时,其隐状态和观测状态分别对应什么? HMM 用于 NER 时的隐状态与观测状态一、HMM 基本框架回顾HMM 是一个双重随机过程隐状态链: z₁ → z₂ → z₃ → ... → zₙ 马尔可夫转移不可直接观测 ↑ ↑ ↑ ↑ 观测序列: x₁ x₂ x₃ ... xₙ 由隐状态生成可观测两个核心假设马尔可夫假设当前隐状态只依赖前一个隐状态P(zt∣zt−1)P(z_t|z_{t-1})P(zt​∣zt−1​)观测独立假设当前观测只依赖当前隐状态P(xt∣zt)P(x_t|z_t)P(xt​∣zt​)二、NER 中的对应关系隐状态 实体标签序列隐状态是不可直接观测的、需要推断的目标对应每个词或字的 NER 标签。采用 BIO 编码方案时隐状态集合为隐状态含义B-PER人名起始I-PER人名内部B-ORG机构起始I-ORG机构内部B-LOC地名起始I-LOC地名内部O非实体若实体类别有 K 种隐状态数量 2K12K 12K1每个类别 B/I 各一个 O。观测状态 输入文本序列观测状态是可直接看到的输入对应句子中的每个词或字。具体示例观测序列(词): 苹果 公司 在 加州 成立 于 1976年 ↑ ↑ ↑ ↑ ↑ ↑ ↑ 隐状态(标签): B-ORG I-ORG O B-LOC O O B-DATEHMM 要素NER 对应说明隐状态ztz_tzt​第 t 个词的 NER 标签不可观测需推断观测xtx_txt​第 t 个词本身可直接观测的输入初始概率π\piπ句首词的标签分布句首更可能是 B-X 或 O不太可能是 I-X转移概率AAA标签间的转移概率如 B-ORG→I-ORG 概率高I-ORG→B-PER 概率低发射概率BBB给定标签时词的概率如 P(“公司”|I-ORG) 较高P(“公司”|B-LOC) 较低三、三个概率矩阵的具体含义1. 初始概率π\piππiP(z1si)\pi_i P(z_1 s_i)πi​P(z1​si​)句首位置的标签分布π(B-ORG) 0.15 句首常以机构名开头 π(B-PER) 0.10 句首常以人名开头 π(O) 0.60 句首最常见的是非实体词 π(I-ORG) 0.01 句首极少是实体内部词结构约束2. 转移概率AAAAijP(ztsj∣zt−1si)A_{ij} P(z_t s_j \mid z_{t-1} s_i)Aij​P(zt​sj​∣zt−1​si​)标签间的转移规律体现 BIO 结构约束前一标签 → 当前标签转移概率解释B-ORG → I-ORG高 (0.7)实体起始后通常跟内部词I-ORG → I-ORG中 (0.4)多词实体继续延伸I-ORG → O中 (0.3)实体结束转为非实体I-ORG → B-PER低 (0.05)实体结束后开始新实体O → I-ORG极低 (0.01)非实体不能直接跳到实体内部B-ORG → B-LOC低 (0.05)两个实体直接相邻较少转移概率天然编码了 BIO 标签的结构合法性约束这是 HMM 用于序列标注的优势。3. 发射概率BBBBi(w)P(xtw∣ztsi)B_i(w) P(x_t w \mid z_t s_i)Bi​(w)P(xt​w∣zt​si​)给定标签时观测到某词的概率P(公司 | I-ORG) 0.08 公司常出现在机构名内部 P(公司 | B-LOC) 0.001 公司极少作为地名起始 P(在 | O) 0.05 在是非实体高频词 P(苹果 | B-ORG) 0.03 苹果常作为机构名起始 P(苹果 | O) 0.01 苹果偶尔作为普通名词水果四、NER 推断过程给定观测序列句子HMM 通过Viterbi 算法求解最大后验概率的隐状态序列标签序列Y^arg⁡max⁡YP(Y∣X)arg⁡max⁡Y∏t1nP(xt∣yt)⋅P(yt∣yt−1)⋅π(y1)\hat{Y} \arg\max_Y P(Y|X) \arg\max_Y \prod_{t1}^{n} P(x_t|y_t) \cdot P(y_t|y_{t-1}) \cdot \pi(y_1)Y^argYmax​P(Y∣X)argYmax​t1∏n​P(xt​∣yt​)⋅P(yt​∣yt−1​)⋅π(y1​)Viterbi 动态规划递推δt(j)max⁡i[δt−1(i)⋅Aij]⋅Bj(xt)\delta_t(j) \max_i \left[ \delta_{t-1}(i) \cdot A_{ij} \right] \cdot B_j(x_t)δt​(j)imax​[δt−1​(i)⋅Aij​]⋅Bj​(xt​)位置: 1 2 3 4 观测: 苹果 公司 在 加州 ↓ ↓ ↓ ↓ ↓ ↓ ↓ ↓ Viterbi逐位计算最优路径: t1: δ(B-ORG) π(B-ORG) × B(B-ORG|苹果) ← 最优 t2: δ(I-ORG) δ(B-ORG) × A(B-ORG→I-ORG) × B(I-ORG|公司) ← 最优 t3: δ(O) δ(I-ORG) × A(I-ORG→O) × B(O|在) ← 最优 t4: δ(B-LOC) δ(O) × A(O→B-LOC) × B(B-LOC|加州) ← 最优 最优路径: B-ORG → I-ORG → O → B-LOC五、HMM 用于 NER 的局限性局限说明观测独立假设过强HMM 假设P(xt∣zt)P(x_t|z_t)P(xt​∣zt​)只依赖当前词无法利用上下文词信息。但 NER 中苹果是 ORG 还是 MISC取决于上下文“苹果发布财报” vs “吃了个苹果”生成模型方向反了HMM 建模P(x∣z)P(x|z)P(x∣z)标签生成词但实际任务是P(z∣x)P(z|x)P(z∣x)词推断标签生成式建模引入了不必要的建模负担特征利用受限难以融入丰富的重叠特征词缀、词性、词典匹配等而 CRF 等判别模型可灵活使用任意特征这些局限正是 CRF条件随机场和 BiLSTM-CRF 等方法取代 HMM 的原因CRF 直接建模P(Y∥X)P(Y\|X)P(Y∥X)且可利用丰富上下文特征BiLSTM-CRF 进一步用神经网络自动提取上下文表示。六、总结HMM 要素NER 对应隐状态NER 标签序列BIO 编码的实体标签观测状态输入词序列句子中的每个词初始概率句首标签分布转移概率标签间转移编码 BIO 结构约束发射概率给定标签时词的概率推断算法Viterbi 算法求最优标签路径HMM 将 NER 建模为隐标签序列生成可观测词序列的过程隐状态是需要推断的实体标签观测状态是可直接看到的输入文本。其核心局限在于观测独立假设无法利用上下文词信息这也是后续 CRF 和深度学习方法成为主流的根本原因。