Key points are not available for this paper at this time.
大規模言語モデル(LLMs)に関する研究は、最近急速に増加しており、主に1によって紹介され、2のデコーダー専用のバリエーションによってさらに進化したトランスフォーマーに基づくアーキテクチャに焦点を当てています。現代の研究は通常、アーキテクチャの複雑さとトレーニングデータの量を増やすことでモデルの能力を向上させることを目指しています。しかし、パフォーマンスを維持しつつモデルのサイズを削減する方法を探る研究は限られています。本研究では、デコーダー専用のトランスフォーマーアーキテクチャに対して、ParallelGPT (p-gpt)、LinearlyCompressedGPT (lc-gpt)、およびConvCompressedGPT (cc-gpt)の3つの変更を導入します。これらのバリエーションは、コード生成タスクにおいて従来のアーキテクチャと同等のパフォーマンスを達成しながら、モデルサイズの削減とトレーニング時間の短縮を実現します。今後の研究と発展を支援するために、モデルの重みとコードベースをオープンソースとして提供します。
Suresh et al. (Mon,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: