開発者は、大規模言語モデルの高額なライセンス料やトレーニングのハードルに直面しており、ChatGPTのようなAIツールを自作するには多額の費用がかかるか、閉じられたプラットフォームに依存しなければなりません。Databricks Dollyはこの痛点に対処し、完全にオープンソースの12Bパラメータの大規模言語モデル(LLM)を提供します。自社のMachine Learning Platformでトレーニングされており、ローカルまたはクラウドで迅速に指示に従った応答を生成できます。このGitHubプロジェクトはAI研究者、データサイエンティスト、企業開発者を対象にしており、公開データセットとモデルの重みを通じて低コストでの自己トレーニングとデプロイを実現します。
性能制限に注意、期待を高くしないこと
Dollyは設計上、オープンソースのアクセス可能性を強調していますが、性能面ではGPT-3.5のようなトップクラスの商業モデルには劣ります。このモデルは主に15,000件の高品質な指示データセットでトレーニングされており、人間のような対話応答の生成に焦点を当てていますが、長い文脈の理解や複雑な推論タスクでは限界があります。開発者は実際のアプリケーションで、簡単な質問応答やコンテンツ生成においては優れた性能を発揮する一方で、深い論理や多段階の推論が必要なシナリオではエラーを起こしやすいことに気づくでしょう。このような性能制限はデータセットの規模やトレーニングリソースに起因しており、ユーザーに対してプロトタイプ開発には適しているが、生産レベルの高精度な要求には不向きであることを思い出させます。

データセットの制限がモデルの生成品質の上限を決定
Dollyのトレーニングの核心はdolly-15kデータセットで、15,000件の人工生成された指示-応答ペアが含まれており、英語のコンテンツと特定のタスクタイプに限定されています。このデータセットは高品質ですが、規模が小さく、多言語や多分野のカバレッジが不足しているため、モデルは非英語のタスクや専門知識の問い合わせに対して一般的な性能を示します。それに対して商業モデルは膨大なネットワークデータでトレーニングされており、Dollyは特定の分野の微調整により適しています。たとえば、企業内部のカスタマーサービスの対話や簡単なコード生成などです。開発者はこのデータセットを出発点として、自分で拡張してモデルの汎用性を向上させることができます。
GitHubページにはデータセットの出所とライセンスが詳細に記載されており、すべてApache 2.0ライセンスで商用利用が容易です。この点がDollyをオープンソースコミュニティで際立たせており、parquet形式のデータを直接ダウンロードし、Hugging Faceやローカル環境で確認・修正することができます。
他のインスタンスでDollyの応答を簡単に生成
Databricksプラットフォームに依存することなく、Dollyのモデル重みはHugging Faceにアップロードされており、Transformersライブラリを使用してCPUまたはGPU上でリアルタイム推論をサポートしています。Python環境を開いて、数行のコードで12Bモデルをロードしてテキストを生成できます。たとえば、pipelineインターフェースにプロンプトを入力することで、迅速に指示に従った応答を得ることができます。この設計は特に個人開発者や小規模チームに適しており、ColabやローカルのJupyterノートブックでテストする際に高価なハードウェアは不要です。公式は、7Bまたは3Bのバリアントを使用して生成を加速し、速度と品質のバランスを取る方法を示すサンプルスクリプトを提供しています。
実際に運用する際は、A100 GPUまたは複数のカードを並行して使用することをお勧めします。生成速度は毎秒数十トークンに達することができます。クラウドAPIの呼び出しと比較して、このようなローカルデプロイはコストと遅延を大幅に削減し、特にプライバシーに敏感な企業アプリケーションに適しています。
カスタムインスタンスでDollyモデルを続けてトレーニング
Dollyの最大の価値は、続けてトレーニング(ファインチューニング)が可能であることです。自社のデータセットを使用してDatabricksやDeepSpeedなどの他のフレームワークで微調整できます。GitHubはデータ準備、モデルのロード、評価スクリプトを含む完全なトレーニングレシピを提供しており、初心者が手順に従って単独またはクラスターで実行できるようにしています。このプロセスはLoRAなどの効率的な方法をサポートしており、コンシューマー向けGPUで数時間で企業の特定のタスク(法律文書の要約や医療質問応答など)に適応できます。
プロジェクトはMLflowを統合して実験を追跡し、異なるハイパーパラメータの効果を比較しやすくしています。OpenAIへの依存を避けたいチームにとって、Dollyはデータからデプロイまでのエンドツーエンドのオープンソースパスを提供します。最新のコミットでは性能の最適化とバグ修正が行われており、モデルのオープンソースLLMランキングでの競争力を維持しています。
製品名:Dolly / Databricks Dolly
公式サイト:https://github.com/databrickslabs/dolly

