RankMixer 中 Semantic Split(语义切分,即分组式 Tokenizer)与 Auto Split(自动切分)是
两种用于构造非序列 Token(NS-tokens)的核心方案,二者在设计思路、实现逻辑和工程效率上
存在显著差异。
一、 Semantic Split(语义切分)Token 构造方式
Semantic Split 也被称为 Group-wise Tokenizer,核心逻辑是基于人工先验知识对特征进行语义分组。
构造流程:
人工将数百个工业特征按照业务语义手动划分为多个独立分组 {g₁, ..., g_{L_{NS}}}。
每个分组内的特征单独拼接,通过该分组专属的独立 MLP 进行投影变换。
每个分组输出一个维度统一的 d 维 Token,最终拼接得到 L_{NS} 个 NS-tokens。
核心特点:
完全贴合业务语义,同语义特征在投影过程中不会被无关特征干扰。
每个分组拥有独立的投影参数,模型对语义组内特征的学习更聚焦。
依赖人工经验划分分组,分组质量直接影响最终效果,无法保证全局最优。
二、 Auto Split(自动切分)Token 构造方式
Auto Split 即自动切分 Tokenizer,完全摒弃人工分组操作,通过全局稠密投影实现 Token 生成。
构造流程:
将所有非序列特征直接拼接为一个完整的全局特征向量。
通过一个统一的全局 MLP 对该向量进行稠密投影,MLP 的输出维度固定为 d * L_{NS}。
将投影后的长向量按维度均匀切分,直接得到 L_{NS} 个维度为 d 的 NS-tokens。
核心特点:
无需人工介入特征分组,完全由模型自主学习最优的特征组合方式。
仅执行一次全局 MLP 前向传播,大幅减少内核启动次数,计算效率显著高于分组式方案。
实验验证其最终效果优于人工语义分组,说明人工经验划分的语义组并非全局最优解。
三、 两种方案核心差异对比
表格
对比维度 Semantic Split Auto Split
分组逻辑 人工按业务语义手动划分 无人工分组,全局自动处理
MLP 数量 L_{NS} 个独立分组 MLP 1 个全局统一 MLP
计算效率 多次内核启动,开销大 单次稠密投影,效率更高
效果上限 受人工经验限制,非最优 模型自主学习,效果更优
工程成本 需人工梳理特征语义,成本高 零人工预处理,开箱即用
四、 落地选型建议
在工业级推荐系统的 RankMixer 部署中,优先选择 Auto Split 方案,可同时获得更高的计算效率和更优的模型效果;仅当业务特征语义边界极强、需要强制隔离不同类特征的学习过程时,才考虑使用 Semantic Split 方案。