三公机器人

牛牛机器人,三公撑船机器人,微信牛牛机器人

三公撑船机器人 RankMixer 中 Semantic Split(语义切分,即分组式 Tokenizer)与 Auto Split(自动切分)

RankMixer 中 Semantic Split(语义切分,即分组式 Tokenizer)与 Auto Split(自动切分)是

两种用于构造非序列 Token(NS-tokens)的核心方案,二者在设计思路、实现逻辑和工程效率上

存在显著差异。


一、 Semantic Split(语义切分)Token 构造方式


Semantic Split 也被称为 Group-wise Tokenizer,核心逻辑是基于人工先验知识对特征进行语义分组。


构造流程‌:

人工将数百个工业特征按照业务语义手动划分为多个独立分组 {g₁, ..., g_{L_{NS}}}。

每个分组内的特征单独拼接,通过该分组专属的独立 MLP 进行投影变换。

每个分组输出一个维度统一的 d 维 Token,最终拼接得到 L_{NS} 个 NS-tokens。

核心特点‌:

完全贴合业务语义,同语义特征在投影过程中不会被无关特征干扰。

每个分组拥有独立的投影参数,模型对语义组内特征的学习更聚焦。

依赖人工经验划分分组,分组质量直接影响最终效果,无法保证全局最优。

二、 Auto Split(自动切分)Token 构造方式


Auto Split 即自动切分 Tokenizer,完全摒弃人工分组操作,通过全局稠密投影实现 Token 生成。


构造流程‌:

将所有非序列特征直接拼接为一个完整的全局特征向量。

通过一个统一的全局 MLP 对该向量进行稠密投影,MLP 的输出维度固定为 d * L_{NS}。

将投影后的长向量按维度均匀切分,直接得到 L_{NS} 个维度为 d 的 NS-tokens。

核心特点‌:

无需人工介入特征分组,完全由模型自主学习最优的特征组合方式。

仅执行一次全局 MLP 前向传播,大幅减少内核启动次数,计算效率显著高于分组式方案。

实验验证其最终效果优于人工语义分组,说明人工经验划分的语义组并非全局最优解。

三、 两种方案核心差异对比

表格

对比维度 Semantic Split Auto Split

分组逻辑‌ 人工按业务语义手动划分 无人工分组,全局自动处理

MLP 数量‌ L_{NS} 个独立分组 MLP 1 个全局统一 MLP

计算效率‌ 多次内核启动,开销大 单次稠密投影,效率更高

效果上限‌ 受人工经验限制,非最优 模型自主学习,效果更优

工程成本‌ 需人工梳理特征语义,成本高 零人工预处理,开箱即用

四、 落地选型建议


在工业级推荐系统的 RankMixer 部署中,优先选择 Auto Split 方案,可同时获得更高的计算效率和更优的模型效果;仅当业务特征语义边界极强、需要强制隔离不同类特征的学习过程时,才考虑使用 Semantic Split 方案。


Powered By Z-BlogPHP 1.7.3

三公机器人,牛牛机器人,三公撑船机器人,微信牛牛机器人