Quantisierung は、大規模言語モデル (LLM) の管理と KI-Modellen の生成を管理するものであり、完全な品質管理を行うための大きな LLM 標準です。 28 億のパラメータを含む 28 億 K3 のパラメータを使用して、4 ビットのトレーニングを開始し、4 ビットのステータスを確認します。 Üblich waren früher 32-Bit-Gleitkommazahlen fürs Training、ausgeliefert wurden FP16-Gewichte。 FP8 と 8 ビット精度の Gleitkommazahlen および Q4、また 4 ビット フォーマットの Übliche Quantisierungsziele は、Integerwerten speichern または NVFP4 (Nvidia) または MXFP4 (offen) による新しい Gleitmaformate のいずれかを使用します。パラメータの数) が大きいほど、100B リーガ (億万長者、億万長者) での被害が少なくなります (マイスト < 1%)。
ヴァイターレーゼン ナッハ デア アンツァイゲ
ただし、一般に、Quantisierung による品質の損失は、より大きなモデルの使用による損失よりも小さいです。ハードウェアは、センサー、センサー、モデル、および FP16-Genauigkeit のすべての量に適合します。 Der Speicher は Faktor のリミテレンデです。たとえば、グラフィックス カードに 12 GByte VRAM が搭載されている場合、パラメータが 6B 未満のモデルに制限されます (FP16 = パラメータあたり 2 バイト)。さらに、KV キャッシュ用のスペースはこれ以上必要ありません。リアルでエッセンシャルな4Bモデル。 Nutzt man dagegen 4-Bit-Quantisierung、kann man gröhrer Modelle bis zur 20B-Klasse betreiben、zum Beispiel ein GPT-OSS 20B oder das neue AMD Instella 16B A3B。
次のビット: BitNet と Bonsai
4 ビット プロのパラメータを使用して、さまざまな操作を行うことができます。これは基本的に新しいことではありません。したがって、Microsoft は 2025 年 4 月に BitNet b1.58 を使用して、1.58 ビット プロ パラメータを使用するようになりました。 Der schräge Wert ergibt sich aus der Mischkalkulation, wo viele Parameter mit 0 oder 1, also einem Bit geschifert werden, manche andere aber mit bis zu zu zu zu zu zu zu zu zu zu zu zu 4 Bit。
オーホ・ダマルス・ウォー・フォン・ツァイテンヴェンデ・ディ・レーデ。その後、誇大宣伝は再び ab, und die 4-Bit-Quantisierung blieb der Standard (etwa wenn man sich über ollama oder LM Studio ein Modell aus dem Katalog lädt) となります。 Qwen 3.6 を搭載したスタートアップ Prism ML、モデル 27B が必要な場合は、高速ベンチマークの観点から、コンシューマ向けの要件に応じて eines Nemotron 3 Ultra (550B) の品質を得ることができます。 Bonsai には少なくとも 4 GByte の RAM が搭載されています。 Handys と Rechchern の GPU ナッツバーさえも知りませんでした。このためには、LLM 推論の共通ランタイム環境である llama.cpp の適応されたバリアントが必要です。 Ubuntu でのテストでは、「Ternary」-Variante の技術を使用し、1.7 ビット プロ ゲヴィヒト アウスコムトと 7.2 GByte の総量 (FP16 での統計は 54 GByte) を使用し、Nvidia RTX 4070 GByte To Generic To 125 を使用しています。 GByteの総リスト。ダス・イスト・メフル・アルス・パサベル。 1 秒あたりの Ab 30 トークン (T/s) 対話型チャットで会話を楽しみながら、さまざまな情報を共有できます。 Im “Reasoning”-Modus, wenn das Modell erst Token für den internen Gebrauch generatedziert, bevor die Final Antwort an den Benutzer geht, haben sich 60 T/s als akzeptabel establiert。また、ユーザーに対して 17 秒のセキュリティを実行し、モデル 1000 の思考トークンを生成します。
Die Antwortqualität war dabei inhaltlich gat, allerdings von der sprachlichen Korrektheit im Deutschen sehr zweifelhaft。オリジナル モデルは、ドイツの Rechtschreibung、Wortwahl および Grammatik の帽子、フィールド盆栽 27B durch kreative Wortneuschöpfungen und Rechtschreibfehler auf (zB Haustiherd statt Haustier) を含む中国の Wurzeln keinerlei 問題を歩き回ります。
モバイルと CPU の使用: 教育の基礎
ヴァイターレーゼン ナッハ デア アンツァイゲ
8 GByte RAM を搭載した Asus Zenfone 9 と、Einsatz のアプリケーション「LLM AI Server with llama.cpp」を搭載したスマートフォンをテストします。ハグフェイスなどの快適なモデルをダウンロードし、Web UI をブラウザから直接ダウンロードしてください。アプリはスピードを逃しません。警告は 2 T/秒で実行されます。 27B-auf 8B-oder 4B-Varianten nicht grundlegend を参照してください。
CPUの動作も同様です。フローター Intel Core i7-14700K は、20 カーネン / 28 スレッドで 2 ビス 3 T/s を実現しており、これは非常に重要なことでした。 In die Schublade “netter Showcase ohne praktische Nutzbarkeit” ist auch Colibri einzuordnen: Der Hersteller der eigenen LLM-Laufzeitumgebung verspricht ein stark quantisiertes GLM 5.2 mit 744B Parametern auf Consumer-Hardware ganz mit the Consumer-Hardware RAM zu 3 GBマッヘン。インターネットの機能を最大限に活用します。 1 秒あたり 0.3 トークンが必要です。SSD 帽子を着用する必要があります。 Für die 1000 Reasoning-Token aus dem voorgein Beispiel wartet man also fast eine Stunde.
(フォ)