博客
关于我
Meta发布首个「非参数化」掩码语言模型NPM:吊打500倍参数量的GPT-3
阅读量:799 次
发布时间:2023-04-15

本文共 949 字,大约阅读时间需要 3 分钟。

视学算法:Meta发布首个非参数化掩码语言模型NPM

近年来,大型语言模型在自然语言处理领域取得了显著进展,但其训练成本高昂、难以更新,同时在处理长尾知识和罕见短语方面表现欠佳。这些模型通常采用预测层中的softmax层,限制了其输出词汇的多样性。为了解决这些问题,研究人员联合提出了一种新型模型——非参数化掩码语言模型(NonParametric Masked language model, NPM)。

NPM的核心思想

NPM通过参考语料库中的非参数化分布来代替传统的softmax输出层,从而实现对任意长度短语的无限制预测。这种方法不仅能够有效处理罕见短语和长尾知识,还能预测几乎未见过的外部语言(如韩语单词)。

NPM的训练与推理

  • 编码器的作用

    NPM由一个编码器组成,该编码器将语料库中的所有短语映射到一个密集的向量空间中。在推理阶段,编码器将带有[MASK]的查询向量映射到相同的向量空间,并从语料库中检索出对应的短语填充[MASK]。

  • 推理的实现

    为了提高检索效率,研究人员采用了基于k近邻搜索(kNN)的批内近似方法。例如,对于一个由4个BPE token组成的短语(如The Thessaloniki),分别从起点和终点向量进行k近邻搜索,检索出最接近的短语开始和结束,从而填充[MASK]。

  • 训练难点

    NPM在训练过程中面临两个关键问题:

    • 检索效率:完整语料库的检索会耗时耗力。研究人员通过批内近似方法,将检索目标限定在批次内的其他序列中。
    • 片段掩码:研究人员扩展了传统的span masking策略,引入了[MASKs][MASKe],以便更方便地检索和填充片段的起点和终点向量。
  • 实验结果

    NPM在多个基线模型上展现出优越性能,包括RoBERTa、GPT-3和OPT 13B等。无论是闭包任务还是开放式任务,NPM都能显著提升预测效果。例如,在情感分析任务中,NPM成功区分了“廉价”和“质量差”的含义,这表明其非参数训练与对比性目标的有效性。

    总结

    NPM通过非参数化掩码预测,打破了传统语言模型的输出限制,为处理长尾知识和罕见短语提供了新的解决方案。尽管其训练和检索过程仍面临挑战,但其在零样本和无样本任务中的表现令人瞩目。未来,NPM有望在更多应用场景中展现其潜力。

    转载地址:http://ogrfk.baihongyu.com/

    你可能感兴趣的文章
    mysql5.7 安装版 表不能输入汉字解决方案
    查看>>
    MySQL5.7.18主从复制搭建(一主一从)
    查看>>
    MySQL5.7.19-win64安装启动
    查看>>
    mysql5.7.19安装图解_mysql5.7.19 winx64解压缩版安装配置教程
    查看>>
    MySQL5.7.37windows解压版的安装使用
    查看>>
    mysql5.7免费下载地址
    查看>>
    mysql5.7命令总结
    查看>>
    mysql5.7安装
    查看>>
    mysql5.7性能调优my.ini
    查看>>
    MySQL5.7新增Performance Schema表
    查看>>
    Mysql5.7深入学习 1.MySQL 5.7 中的新增功能
    查看>>
    Webpack 之 basic chunk graph
    查看>>
    Mysql5.7版本单机版my.cnf配置文件
    查看>>
    mysql5.7的安装和Navicat的安装
    查看>>
    mysql5.7示例数据库_Linux MySQL5.7多实例数据库配置
    查看>>
    Mysql8 数据库安装及主从配置 | Spring Cloud 2
    查看>>
    mysql8 配置文件配置group 问题 sql语句group不能使用报错解决 mysql8.X版本的my.cnf配置文件 my.cnf文件 能够使用的my.cnf配置文件
    查看>>
    MySQL8.0.29启动报错Different lower_case_table_names settings for server (‘0‘) and data dictionary (‘1‘)
    查看>>
    MYSQL8.0以上忘记root密码
    查看>>
    Mysql8.0以上重置初始密码的方法
    查看>>