机器之心报说念皇冠分红
裁剪:泽南、陈萍
皇冠客服飞机:@seo3687之后,Meta 也来卷无穷长险阻文。
Transformers 的二次复杂度和弱长度外推适度了它们延迟到长序列的才略,天然存在线性防御力和情状空间模子等次二次处置决议,但从以往的教会来看,它们在预磨练恶果和下贱任务准确性方面进展欠安。
皇冠体育维基百科皇冠信用长文本是大讲话模子一直在费力的场地。近日,谷歌建议的 Infini-Transformer 引入有用样式,不错将基于 Transformer 的大型讲话模子 (LLM) 延迟到无穷长输入,而不加多内存和推断需求,诱惑了东说念主们的温雅。
确凿就在同期,Meta 也建议了一种无穷长文本工夫。

论文地址:https://arxiv.org/pdf/2404.08801.pdf论文标题:MEGALODON: Efficient LLM Pretraining and Inference with Unlimited Context Length代码:https://github.com/XuezheMax/megalodon
在 4 月 12 日提交的一篇论文中,来自 Meta、南加州大学、CMU、UCSD 等公司、机构引入了 MEGALODON,一种用于高效序列建模的神经架构,险阻文长度不受适度。
MEGALODON 接管了 MEGA(带有门控防御力的指数移动平均)的架构,并进一步引入了多种工夫组件来晋升其才略和踏实性,包括复数指数移动平均(CEMA)、时间步归一化层、归一化防御力机制和具有两个特征的预归一化(pre-norm)残差竖立。

在与 LLAMA2 的平直比较中,MEGALODON 在 70 亿参数和 2 万亿磨练 token 的领域上取得了比 Transformer 更好的恶果。MEGALODON 的磨练耗损达到 1.70,处于 LLAMA2-7B (1.75) 和 13B (1.67) 之间。MEGALODON 联系于 Transformers 的改良在不同任务和模式的一系列基准测试中进展苍劲。
MEGALODON 实质上是一种改良的 MEGA 架构(Ma et al., 2023),它专揽了门控防御力机制和经典指数移动平均(EMA)样式。为了进一步晋升 MEGALODON 在大领域长险阻文预磨练方面的才略和恶果,作家建议了多种工夫组件。当先,MEGALODON 引入了复数指数移动平均 (CEMA) 组件,将 MEGA 中的多维阻尼 EMA 延迟到复数域。其次,MEGALODON 建议了时间步长归一化层,它将组归一化层引申到自总结序列建模任务,以允许沿法则维度进行归一化。
为了提魁岸领域预磨练的踏实性,MEGALODON 进一步建议了归一化防御力,以及通过修改无为收受的预归一化和后归一化样式而具有两跳残差竖立的预归一化。通过粗浅地将输入序列分块为固定块,如 MEGA-chunk 中所作念的那样,MEGALODON 在模子磨练和推理中兑现了线性推断和内存复杂性。
在与 LLAMA2 的平直比较上,适度了数据和推断的同期,MEGALODON-7B 在磨练困惑度方面权贵优于用于磨练 LLAMA2-7B 的起原进的 Transformer 变体。在对长险阻文建模的评估上,包括高达 2M 的多样险阻文长度中的困惑度以及 Scrolls 中的长险阻文 QA 任务讲明了 MEGALODON 对无穷长度序列进行建模的才略。中袖珍基准的其他履行扬弃,包括 LRA、ImageNet、Speech Commands、WikiText-103 和 PG19 讲明了 MEGALODON 在体量和多模态上的才略。
在万达危机之际,凭借着一己之力凑齐2000亿。
www.qixgu.com在光伏行业景气下行周期中,这种成本浪费成为产业不可承受之重。
样式先容
当先,著述粗浅追念了 MEGA( Moving Average Equipped Gated Attention )架构中的重要组件,并酌量了 MEGA 中存在的问题。
MEGA 将 EMA( exponential moving average ) 组件镶嵌到防御力矩阵的推断中,以纳入跨时间步长维度的归纳偏差。具体而言,多维阻尼 EMA 当先通过延迟矩阵 将输入序列 X 的每个维度单独延迟为 h 维,然后将阻尼 EMA 应用于 h 维阴私空间。体式如下:


为了缩短全防御力机制中的二次复杂度,MEGA 粗浅地将 (14-16) 中的查询、键和值序列拆分为长度为 c 的块。(17) 中的防御力单独应用于每个块皇冠分红,产生线性复杂度 O (kc^2 ) = O (nc)。
从工夫上讲,MEGA 中的 EMA 子层有助于拿获每个 token 隔邻的腹地险阻文信息,从而缓解了在超出块规模的险阻文中丢失信息的问题。尽管 MEGA 取得了令东说念主深入的印象,但濒临如下问题:
i)由于 MEGA 中 EMA 子层的抒发才略有限,具有块级防御力的 MEGA 性能仍然落伍于全防御力 MEGA。
ii) 关于不同的任务、数据类型,最终的 MEGA 架构可能存在架构各别,举例,皇冠开户不同的归一化层、归一化模式和防御力函数 f (・) 。
iii) 莫得教会字据标明 MEGA 可延迟用于大领域预磨练。



CEMA:将多维阻尼 EMA 延迟到复数域
为了处置 MEGA 濒临的问题,该接头建议了 MEGALODON。
具体而言,他们创造性地建议了复指数移动平均 CEMA( complex exponential moving average ),将上式(1)改写为如下体式:

并将(2)中的 θ_j 参数化为:

时间步(Timestep)归一化
皇冠账号尽管层归一化与 Transformer 相吞并的性能令东说念主印象深入,但很显然,层归一化不成平直减少沿空间维度(也称为时间步长或序列维度)的里面协变量偏移。
在 MEGALODON 中,该接头通过推断积聚均值和方差将组归一化延迟到自总结情况。

图 2 证实了层归一化和时间步圭臬化。

MEGALODON 中的归一化防御力
此外,该接头还建议了疏淡为 MEGA 定制的归一化防御力机制,以晋升其踏实性。体式如下:

则上式 (17) 中的防御力操作改为:

具有 Two-hop 残差的预范数(Pre-Norm)
通过探望发现,扩大模子大小会变成预归一化不踏实问题。基于 Transformer 块的预归一化不错暗意为(如图 3 (b) 所示):


在原始 MEGA 架构中, 将 φ (19) 用于门控残差贯串 (21) 以缓解此问题。联系词,更新门 φ 引入了更多的模子参数,当模子领域扩大到 70 亿时,不踏实问题仍然存在。MEGALODON 引入了一种名为 pre-norm 的新竖立,具有 two-hop 残差,它仅仅粗浅地从头胪列每个块中的残差贯串,如图 3(c)所示:


履行
为了评估 MEGALODON 在长险阻文序列建模上的可延迟性和恶果,本文将 MEGALODON 延迟到 70 亿领域大小。
LLM 预磨练
为了晋升数据恶果,接头者在磨练经过中披露了 MEGALODON-7B、LLAMA2-7B 和 LLAMA2-13B 的负对数似然 (NLL),如图 1 所示。
皇冠信用网址多少在换取数目的磨练 token 下,MEGALODON-7B 取得了比 LLAMA2-7B 显然更好(更低)的 NLL,进展出更好的数据恶果。
今年的世界杯足球赛备受关注,其中以梅西、C罗、内马尔和哈兰德为代表的明星球员更是成为了众人的焦点。然而,在比赛中,一位名不见经传的球员却成为了大家的谈资。这名球员名叫张华,来自中国。在一场比赛中,他以惊人的表现成功将一颗点球射入对方的球门,为中国队打入了历史性的一球,这让全国人民都为之欢呼。
图 4 证实了辞别使用 4K 和 32K 险阻文长度的 LLAMA2-7B 和 MEGALODON-7B 在每个确立上的平均 WPS( word/token per second )。关于 LLAMA2 模子,该接头使用 Flash-Attention V2 加快全防御力的推断。在 4K 险阻文长度下,由于引入了 CEMA 和时间步归一化,MEGALODON-7B 比 LLAMA2-7B 稍慢(约 6%)。当将险阻文长度延迟到 32K 时,MEGALODON-7B 显然比 LLAMA2-7B 快(约 32%),这讲明了 MEGALODON 关于长险阻文预磨练的推断恶果。
博彩娱乐平台登录
短险阻文评估
表 1 总结了 MEGALODON 和 LLAMA2 在学术基准上的扬弃,以杰出他开源基础模子,包括 MPT、RWKV 、Mamba 、 Mistral 和 Gemma 的比较扬弃。在换取的 2T token 上进行预磨练后,MEGALODON-7B 在通盘基准测试中均优于 LLAMA2-7B。在某些任务上,MEGALODON-7B 的性能与 LLAMA2-13B 十分以至更好。
惊艳皇冠信用网
长险阻文评估
图 5 披露了考据数据集在 4K 到 2M 多样险阻文长度下的困惑度 (PPL)。不错不雅察到 PPL 跟着险阻文长度单调下落,考据了 MEGALODON 在建模极长序列方面的有用性和鲁棒性。

领导微调
表 3 总结了 7B 模子在 MT-Bench 上的性能。与 Vicuna 比拟,MEGALODON 在 MT-Bench 上进展出优胜的性能,况且与 LLAMA2-Chat 十分,尔后者专揽 RLHF 进行了进一步的对王人微调。

中等领域基准评估
为了评估 MEGALODON 在图像分类任务上的性能,该接头在 Imagenet-1K 数据集上进行了履行。表 4 请问了考据集上的 Top-1 准确率。MEGALODON 的准确率比 DeiT-B 晋升了 1.3%,比 MEGA 晋升了 0.8%。

表 5 证实了 MEGALODON 在 PG-19 上的字级困惑度 (PPL),以及与之前起原进的模子,包括 Compressive Transformer 、Perceiver AR、Perceiver AR、块轮回 Transformer 和 MEGABYTE 等的对比。MEGALODON 性能显然跨越。

更详备内容请参考论文原文。