IMGNet:符号模式匹配挑战余弦相似度的人脸验证新方法

从爪哇语到人脸识别:一个跨界的灵感
一位来自印度尼西亚的独立研究者最近在 Reddit 的 r/deeplearning 社区分享了他的开源项目 IMGNet——一个人脸验证模型。它最引人注目的地方在于:完全放弃了业界主流的余弦相似度(cosine similarity),转而采用一种名为「滑动窗口符号模式匹配」(sliding window sign pattern matching)的全新度量方式。
余弦相似度自上世纪90年代信息检索领域兴起以来,逐渐成为高维向量比较的事实标准。其数学本质是计算两个向量夹角的余弦值,因此对向量的绝对长度(模)完全不敏感,只关注方向。在人脸识别领域,2015年前后随着 DeepFace、FaceNet 等深度学习模型的崛起,余弦相似度因其计算简单、对向量长度不敏感的特性被广泛采用。FaceNet 通过 L2 归一化将嵌入投影到单位超球面,使余弦相似度等价于欧氏距离,进一步简化了计算。然而其根本局限在于:它本质上衡量的是两个向量在高维球面上的角度差异,完全依赖全局方向信息,而忽略了嵌入向量各维度之间的局部关系结构——这正是 IMGNet 试图突破的瓶颈。
作者的灵感来源相当独特。他提到,在爪哇语中「感谢」是 "matur suwun",而在巽他语中同样的情感表达是 "hatur nuhun"——表面形式完全不同,含义却完全一致。身份是通过关系结构而非绝对数值来保持的。这正是 IMGNet 的核心思想:与其比较嵌入向量的全局角度方向(这正是余弦相似度所做的),不如在嵌入向量的重叠窗口中寻找局部一致的符号模式。
这一类比在语言学中有深厚的理论基础。结构主义语言学奠基人索绪尔(Ferdinand de Saussure)早在20世纪初便指出,语言符号的意义来自于系统内部的差异关系,而非符号本身的绝对属性。不同语言可以用完全不同的声音形式表达同一概念,因为意义存在于关系网络中。将这一洞察迁移至人脸嵌入领域,意味着身份信息或许同样编码在维度间的相对关系(符号模式)中,而非嵌入向量的绝对方向。
这种从语言学类比出发的思路,为长期依赖余弦相似度的人脸识别领域提供了一个耐人寻味的新视角。

技术核心:三大创新点
SW Block:多尺度关系运算
IMGNet 的第一层用一种「多尺度关系运算」替代了标准卷积。对于每个像素,它会计算该像素与所有邻居在质数窗口尺寸 {3, 5, 7} 下的差值。这样每个像素会产生 240 个差值,再由一个小型 MLP 将这些差值映射到输出通道。
采用质数窗口尺寸是一个细节考量,避免了不同尺度间的采样重叠冗余,让多尺度信息更具互补性。在传统卷积神经网络中,标准卷积核通常使用 3×3 或 5×5 的固定尺寸,各尺度之间存在系统性的像素重叠,导致感受野扩展时携带冗余信息。质数尺寸的组合 {3, 5, 7} 在数论上保证了不同窗口之间的最小公倍数更大,从而使各尺度捕获的空间模式在统计上更加独立互补。这一设计思路与信号处理中的「正交基分解」有相通之处——通过构造尽量正交(互不冗余)的基函数集合,最大化每个基函数所携带的独立信息量,使得有限的计算资源得到更高效的利用。
值得补充的是,「滑动窗口」这一概念本身在技术史上有深厚的根基。滑动窗口技术起源于数字信号处理领域,是时间序列分析和图像处理中的基础操作,其核心思想是用一个固定大小的「窗口」在数据上逐步移动,在每个位置提取局部统计特征。IMGNet 将这一思想从空间域迁移至特征向量的维度域,使得嵌入向量间的比较不再是全局性的角度计算,而是多个局部窗口上符号一致性的聚合判断——这是一次概念层面的跨域迁移,而非简单的工程复用。
IMG Sign MSE Loss:纯符号模式的损失函数
据作者所述,这是首个完全基于符号模式一致性、不依赖任何幅值信息的人脸验证损失函数。其核心计算逻辑如下:
score = mean(gate(tanh(β · E1 · E2))) # 滑动窗口,β=10
loss_same = ((1 - score) ** 2).mean() # 推向 1.0
loss_diff = (score ** 2).mean() # 推向 0.0
这里的 tanh(β · E1 · E2) 是整个设计的关键。当 β 足够大时(此处取10),tanh 函数会将乘积的符号信息锐化为接近 ±1 的值,从而将嵌入向量的连续幅值信息「压缩」为纯粹的符号一致性信号。这与信息论中的「符号编码」思想类似:放弃幅度精度,换取结构稳定性。从更广泛的视角看,这一设计与神经科学中的「脉冲神经网络」(Spiking Neural Networks)有概念上的共鸣——生物神经元通过脉冲的「发放/不发放」二值模式传递信息,而非连续的激活幅度,这种机制被认为在噪声环境下具有更强的鲁棒性。这也解释了训练稳定性数据:在第 29 到 50 个 epoch 期间,符号模式损失的方差仅为 ±0.40%,而基于幅值的变体则高达 ±2.25%,这意味着符号模式方法在训练过程中显著更稳定。
统一阈值与投票机制
IMGNet 定义了三个度量指标——IMG Sign Score、AMP IMG Score 和 Chain Score,它们都在 [0,1] 区间内运作,并共享一个从 IMG Sign 扫描得出的单一阈值。
最终判定采用投票系统:2/3 或 3/3 通过即判定为「匹配」(MATCH),1/3 通过为「不确定」(UNCERTAIN),0/3 为「不同」(DIFFERENT)。这种多指标投票的设计思路与集成学习(Ensemble Learning)中的多数投票机制异曲同工——通过融合多个互补视角的判断,降低任单一度量误判带来的风险,从而整体提升系统鲁棒性。「不确定」类别的设置尤为值得关注,这在工业部署中具有实际意义:允许系统主动识别自身置信度不足的样本,将其转交人工审核,而非强制输出一个可能错误的二元判定。这种「拒绝选项」(reject option)在医疗影像、金融风控等高风险场景中已有成熟应用,IMGNet 将其引入人脸验证,体现了对实际部署场景的细致考量。
实验结果:小模型,可观的表现
IMGNet 的模型仅有 10.58 MB(FP32),在 CASIA-WebFace 数据集(49 万张图像)上训练。CASIA-WebFace 是由中国科学院自动化研究所于2014年发布的大规模人脸数据集,包含约10,575个身份的494,414张图像,长期作为轻量级人脸识别研究的标准训练集,在算力受限的独立研究场景中尤为常用。值得注意的是,当前 SOTA 模型(如 AdaFace、CosFace)通常在 MS-Celeb-1M(约580万张)或 WebFace260M(约2.6亿张)等数十倍乃至数百倍体量的数据集上训练,因此 CASIA-WebFace 上的结果更多反映的是方法论层面的相对优势,而非绝对性能上限。
在多个标准人脸验证基准上,符号模式度量(IMG Sign)均略优于余弦相似度:
| 数据集 | IMG Sign | Cosine |
|---|---|---|
| LFW | 96.27% | 95.53% |
| AgeDB-30 | 78.80% | 77.22% |
| CALFW | 78.73% | 78.32% |
| CPLFW | 76.85% | 74.62% |
| 综合 | 81.02% | 79.49% |
LFW(Labeled Faces in the Wild)、AgeDB-30、CALFW、CPLFW 是业界公认的验证基准,分别侧重测试跨光照、跨年龄、跨姿态等不同挑战条件下的泛化能力。AgeDB-30 专注于年龄跨度达30年以上的跨年龄验证;CPLFW 则刻意引入大角度姿态变化,是公认最具挑战性的姿态鲁棒性测试之一。IMGNet 在这两个难度较高的基准上均表现出更明显的优势幅度,暗示符号模式对这类极端变化具有更强的稳健性。
虽然绝对精度距离 SOTA 模型仍有差距,但在如此紧凑的模型规模和相同的嵌入条件下,符号度量全面超越余弦度量,本身就是一个值得关注的信号。
最关键的发现:符号一致性是嵌入的固有属性?
真正让这个项目具备理论深度的,是作者的一个交叉实验。他将 IMG Sign Score 应用到预训练的 ArcFace(buffalo_l)嵌入上,且完全不进行重新训练。
ArcFace(2018,Deng et al.)是目前人脸识别领域最具影响力的损失函数之一,通过在角度空间引入加性角度裕量(additive angular margin),强制嵌入向量在超球面上形成紧凑的类内聚合和类间分离。其核心思想是:在 softmax 分类损失的基础上,对目标类别的角度增加一个固定裕量 m(论文中取0.5弧度),迫使模型学习更具判别性的特征。这一设计使嵌入向量在高维超球面上形成高度结构化的分布——同一身份的嵌入聚集在球面上的小锥形区域内,不同身份的锥形区域间保持明确的角度间隔,而这种训练产生的几何结构,正是IMGNet交叉实验能够成立的重要前提:高度结构化的嵌入空间天然包含丰富的局部模式信息。buffalo_l 是 InsightFace 框架中基于 ArcFace 训练的高性能预训练模型,其设计初衷完全面向余弦相似度度量。将一个为不同目标训练的度量方式直接迁移至该模型嵌入,本质上是一次「度量与训练目标解耦」的零样本探针实验(zero-shot probing experiment)。
结果是:在 LFW 上,IMG Sign 达到 99.58%,仅比 ArcFace+Cosine 的 99.82% 低 0.24%。
这个结果的含义相当深远。它暗示着:符号模式一致性可能是训练良好的人脸嵌入的一种基本属性,独立于训练目标本身。换句话说,即便一个嵌入是为余弦相似度而训练的,其内部的符号结构依然携带了足够的身份信息。
这与近年来表征学习领域对「嵌入空间内在几何结构」的研究方向不谋而合。2021年前后,多项研究发现在 ImageNet 等大规模数据集上充分预训练的视觉模型,使用余弦、欧氏、曼哈顿等多种距离度量时,检索性能差异远小于预期,暗示强监督训练会产生某种度量鲁棒的特征结构——即特征空间的信息冗余度和结构完整性远超任何单一度量所能充分利用的范围。2023年前后兴起的「通用度量学习」(Universal Metric Learning)研究进一步发现,在大规模数据集上充分训练的嵌入模型,其特征空间会自发形成某种「度量无关」的内在秩序——无论使用余弦距离、曼哈顿距离还是其他度量,判别能力均能保持在较高水平。IMGNet 的交叉实验为这一理论提供了来自符号域的新佐证,同时也为「相似度度量应当与训练目标共同设计,而非默认使用余弦」这一假设提供了初步支持。
一个未经验证的意外发现
在构建交互式消融可视化工具(带自定义多边形遮罩)时,作者发现了一个有趣的现象:对同一个人的照片遮挡相同的面部区域,会在相似的嵌入维度上产生 delta 尖峰;而对不同人的照片,尖峰位置则显著不同。
这暗示重叠滑动窗口损失可能在嵌入空间中诱导出隐式的空间组织结构。若这一观察得到正式验证,其意义将延伸至可解释性人工智能(XAI)领域——意味着该模型的嵌入维度可能与特定面部区域存在可追踪的对应关系,从而为「黑盒」人脸识别模型的透明度提供新的分析入口。这一方向与近年来「概念瓶颈模型」(Concept Bottleneck Models)和「概念激活向量」(TCAV)等 XAI 方法的研究目标高度契合——这些方法同样致力于在连续嵌入空间中找到与人类可理解概念(如面部器官、表情特征)之间的可追踪映射关系。如果 IMGNet 的嵌入维度确实隐含空间对应结构,则意味着该损失函数在提升判别性能的同时,意外地引导模型习得了更具可解释性的特征分解方式。作者坦诚地强调,这一发现「尚未经过正式验证」,属于初步观察。这种对结果保持审慎的态度,在独立研究中值得肯定。
意义与思考
IMGNet 项目的价值,或许不在于刷新了某个榜单,而在于它提出的一个核心命题:度量与损失应当协同设计(metric-loss alignment),而不是习惯性地默认使用余弦相似度。
长期以来,人脸识别乃至整个表征学习领域都把余弦相似度当作理所当然的默认选择。这一习惯的形成有其历史合理性——在 FaceNet 等早期工作中,球面归一化嵌入与余弦度量的组合被反复验证为高效可靠的方案,进而形成了一种路径依赖。这种路径依赖在技术史上并不罕见:QWERTY 键盘布局、TCP/IP 协议栈,乃至深度学习中 ReLU 激活函数的主导地位,都是早期高效方案通过正反馈循环固化为「行业默认值」的典型案例。一旦某种方案成为默认,围绕它积累的工具链、基准测试和预训练模型会进一步强化其地位,使得替代方案即便在某些维度上更优,也面临高昂的迁移成本。然而 IMGNet 用一个仅 10 MB 的轻量级模型和一系列可复现的实验提醒我们:这个默认选择未必是唯一或最优的答案。度量方式本身作为一个可设计变量,在轻量化、边缘部署和特殊应用场景下,可能蕴藏着尚未充分挖掘的潜力。
作者已开放了论文、代码(GitHub)和模型(Hugging Face),欢迎社区就「度量-损失对齐」假设展开讨论。对于关注表征学习本质的研究者而言,这是一个值得深入探索的方向。
项目链接:论文(Zenodo DOI: 10.5281/zenodo.21232755)、代码(github.com/imamgh11/imgnet)、模型(huggingface.co/imghost11/imgnetV1)
核心要点
相关推荐

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。

AI编程助手为何这么烧钱?揭秘Harness背后的真实账单
深度解析AI编程助手Claude Code、Cursor、Cline等工具的隐形成本结构,揭示系统提示词、Agent往返震荡和Prompt缓存如何影响你的账单,提供实用的成本优化策略。