PC Local AI 2026: New Open Models Bring Offline Chat to Your Hardware

Big-name KI ist inzwischen nicht mehr nur etwas für die Cloud: In den letzten Tagen haben gleich mehrere Anbieter neue offene Modelle veröffentlicht, die ausdrücklich darauf ausgelegt sind, direkt auf dem eigenen PC zu laufen. Das macht lokale Sprach-KI für Spieler und Technikfans besonders attraktiv – nicht nur wegen der Offline-Nutzung, sondern auch weil die Kostenstruktur anders funktioniert als bei Abo-Chatbots.

Meta brachte in sehr kurzer Zeit neue Open-Weight-Modelle, Nvidia legte mit einem weiteren offenen Download-Modell nach, und gleichzeitig präsentierte AMD Messwerte samt Hardware-Empfehlungen zu einem Meta-Modell. Wer daraus ableitet, dass die eigene “ChatGPT-Alternative” nicht zwingend ein Abo braucht, bekommt in einem neuen Grundlagen-Guide die passenden Antworten: von der Idee hinter lokalen LLMs über die Hardware-Frage bis zu konkreter Software für den Einstieg.

Lokale KI für PC: Was sich gerade geändert hat

Nvidia und Meta stellten innerhalb von nur zwei Tagen zwei offene KI-Modelle vor, die für den Betrieb auf dem heimischen Rechner gedacht sind: Nemotron 3.5 Lightning und Muse Glimmer 30B. Praktisch zeitgleich lieferte AMD eigene Messdaten und Hardware-Hinweise für das KI-Modell von Meta.

Im Mittelpunkt steht dabei eine einfache Idee: Wer das Modell einmal herunterlädt, betreibt es danach vollständig auf dem eigenen System. Dadurch entfallen laufende Nutzungskosten und auch das ständige Hin-und-her mit Servern – was besonders dann zählt, wenn sensible Inhalte verarbeitet werden sollen oder die Verbindung unterwegs nicht zuverlässig ist.

Quick facts

  • Meta und Nvidia veröffentlichten innerhalb von zwei Tagen offene Modelle für lokalen Betrieb: Nemotron 3.5 Lightning und Muse Glimmer 30B.
  • AMD ergänzte parallel eigene Messwerte und Hardware-Empfehlungen zum Meta-Modell.
  • Lokale KI bedeutet: Modellgewichte werden einmalig heruntergeladen, danach laufen Berechnungen vollständig auf dem PC.
  • Für den Einstieg reicht laut Guide teils bereits eine Gaming-Grafikkarte mit 8 GiB VRAM; entscheidend ist vor allem der Grafikspeicher.
  • Empfohlene kostenlose Tools für lokale KI: LM Studio, Ollama und ComfyUI.
  • Einsteiger-Modelle reichen von GPT-OSS-20B (ca. 16 GiB VRAM) bis zu größeren Varianten ab etwa 60 GiB Speicher.
  • Community-Update nennt u. a. Qwen3.8-27B (Apache-2.0, 14. August) sowie Kritik an Ollama samt Alternativen.

Wie lokale KI funktioniert – und warum es trotzdem “LLMs” sind

Lokale KI bedeutet, dass ein KI-Modell komplett auf der eigenen Hardware läuft. Die Modelldatei wird einmalig gezogen, anschließend finden die Berechnungen auf dem PC statt und keine Eingabe verlässt das Gerät. Technisch handelt es sich dabei um dieselbe Familie großer Sprachmodelle, die auch hinter Angeboten wie ChatGPT, Gemini oder Claude stecken.

Der Unterschied liegt im Vertriebsweg: Hersteller wie Meta, Google, OpenAI, Alibaba und Mistral stellen fertige Modellgewichte zum Download bereit. Streng genommen handelt es sich dabei meistens um “Open Weights” statt um “Open Source”, weil Trainingsdaten und Trainingsrezepte in der Regel nicht veröffentlicht werden. Für die Praxis zählt aber vor allem: Modelle lassen sich kostenlos nutzen, anpassen und in eigene Programme integrieren.

Mittlerweile geht es weit über reines Chatten hinaus. Lokale Modelle können Dokumente zusammenfassen, übersetzen, beim Programmieren helfen, Bilder analysieren, Fotos und kurze Videoclips erzeugen oder Audio über Whisper transkribieren.

Abo, API oder lokal: drei Wege – und der lokale ist der einzige ohne laufende Serverkosten

Der lokale Weg ist neben Browser-Abos und der API der dritte Verbreitungsweg für Sprachmodelle, aber der einzige ohne laufende Kosten und ohne Datenübertragung. Abo-Modelle liefern starke Systeme inklusive Webfunktionen und Bildgenerierung, aber mit Nutzungslimits und nur über die Server der Anbieter.

Die API rechnet typischerweise pro verarbeiteten Token ab – bei intensiver Nutzung können dadurch schnell dreistellige Monatsbeträge entstehen. Lokal hingegen sind die Modellgewichte gratis, bezahlt wird primär einmal für die Hardware. Außerdem bleiben Modelle dauerhaft nutzbar, selbst wenn Anbieter später neue Versionen nachschieben.

Offline-Vorteile, aber auch Grenzen: Datenschutz vs. “Frontier”-Qualität

Der wichtigste Pluspunkt ist Datenschutz: Eingaben und Antworten bleiben auf dem eigenen Rechner und landen weder in Serverstatistiken noch in späteren Trainingsdaten. Das betrifft nicht nur private Fragen, sondern auch Dokumente, Notizen oder Themen mit personenbezogenen Daten – ein Punkt, der im Kontext von DSGVO und Cloud-Diensten besonders relevant ist.

Ebenso praktisch ist der Offline-Betrieb. Lokale Modelle funktionieren auch unterwegs im Zug oder im Funkloch und sind erreichbar, selbst wenn die Server großer Anbieter überlastet sind oder ausfallen.

Natürlich gibt es auch Nachteile. Lokale Modelle erreichen bisher nicht die Qualität sogenannter “Frontier-Modelle” aus der Cloud. Der Abstand ist zwar seit 2024 spürbar kleiner geworden, bleibt aber real – insbesondere bei komplexen Schlussfolgerungen und bei Wissen, das stark an tagesaktuellen Fakten hängt.

Ohne Internetanbindung fehlt zudem das Tagesgeschehen: Ein lokales Modell arbeitet mit dem Wissensstand seines Trainings. Außerdem ist der Einstieg erklärungsbedürftig, weil Begriffe wie Quantisierung und Kontextfenster für lokale Setups erst einmal verstanden werden müssen.

Die Hardware-Realität: VRAM bestimmt, welches Modell überhaupt läuft

Für die Eignung eines PCs ist in erster Linie die Menge des Grafikspeichers entscheidend. Für flüssiges Arbeiten muss das komplette Modell in den VRAM passen. Wie viel Speicher nötig ist, hängt eng mit Quantisierung zusammen: In voller Genauigkeit belegt jeder Parameter zwei Byte.

Als Orientierung nennt der Guide: Ein Modell mit 30 Milliarden Parametern benötigt in voller Genauigkeit über 55 GiB. Mit 4-Bit-Quantisierung schrumpft dieselbe Datei bei überschaubaren Qualitätsverlusten auf unter 20 GiB.

Eine Faustregel für Einsteiger lautet daher: Dateigröße des Modells plus ein bis zwei GiB Puffer ergibt den benötigten VRAM. Beim Alltag zählt zuerst die Frage, ob das Modell komplett in den VRAM passt; Tempo und Feinheiten kommen danach.

Welche VRAM-Klassen passen zu welchen Modellen?

8 GiB VRAM markieren laut Guide die Einstiegsklasse: Damit laufen kompakte Sprachmodelle bis etwa neun Milliarden Parameter sowie genügsame Bildgeneratoren. 16 GiB gelten als der beste Kompromiss, weil dort mittelgroße Modelle um etwa 20 Milliarden Parameter bequem Platz finden.

Der Guide nennt konkrete Preisstände für zwei Beispiele, die am 13. August 2026 im Preisvergleich geprüft wurden: Eine AMD Radeon RX 9060 XT mit 16 GiB startet bei etwa 450 Euro, eine Nvidia GeForce RTX 5060 Ti bei rund 470 Euro – beide Preise liegen durch die Speicherkrise über dem Niveau des Vorjahres.

Ab 24 GiB öffnet sich die Tür zu den spannendsten offenen Modellen; Metas neue Zielgröße wird dabei ausdrücklich mit dieser Marke verknüpft. 32 GiB bleiben Enthusiasten vorbehalten: Eine GeForce RTX 5090 wird mit etwa 4.200 Euro beziffert, eine AMD Radeon AI Pro R9700 mit etwa 1.600 Euro – jeweils mit 32 GiB Speicherausbau.

Grafikkarte vs. RAM: Bandbreite limitiert, Speicher hilft aus

Beim Textgenerieren ist Speicherbandbreite der Engpass: Für jedes einzelne Wortfragment müssen die aktiven Parameter erneut aus dem Speicher gelesen werden. Nvidias High-End mit GDDR7 erreicht knapp 1,8 TB/s, Mittelklasse-Modelle liegen bei etwa 320 bis 450 GB/s, während ein Desktop-PC mit zwei DDR5-Riegeln ungefähr 90 GB/s schafft.

Die AMD-Messwerte zum 30-Milliarden-Modell zeigen den Unterschied zwischen dediziertem VRAM und gemeinsamem Speicher: Auf einer Radeon AI Pro R9700 erreicht das Modell bis zu 53 Tokens pro Sekunde, auf AMDs Kombiprozessor mit gemeinsamem Speicher sind es 24.

Trotzdem spielt RAM eine Rolle. Er dient als Ausweichquartier, wenn VRAM zu knapp wird. Moderne Ansätze wie “Mixture of Experts” (später im Guide bei den Modell-Empfehlungen aufgegriffen) können diese Auslagerung abfedern. Bei Kombiprozessoren wie AMDs “Strix Halo” alias Ryzen AI Max+ 395 ist sogar ein großer Teil der KI-Aufgaben auf gemeinsamen Speicher ausgelegt, allerdings bei geringerer Bandbreite.

Tools für lokale KI: LM Studio, Ollama und ComfyUI

Für lokale KI decken drei kostenlose Programme laut Guide praktisch alle Kernfälle ab: LM Studio, Ollama und ComfyUI. Damit sind lokal und offline Chat, Programmierhilfe sowie Bild- und Videogenerierung abgedeckt.

LM Studio und Ollama basieren intern auf derselben Technik, “llama.cpp”, inklusive dem Dateiformat “GGUF”. Dadurch lassen sich heruntergeladene Modelle zwischen den beiden Programmen austauschen, und eine einmal getroffene Wahl ist nicht zwangsläufig endgültig.

LM Studio: der bequemste Einstieg ohne Terminal

LM Studio richtet sich an Nutzer, die möglichst wenig mit dem Terminal arbeiten möchten. Die kostenlose App für Windows, macOS und Linux kombiniert eine Chatoberfläche im Stil bekannter Anbieter mit einer eingebauten Modellsuche, die direkt auf Hugging Face zugreift.

Ein besonders anfängerfreundliches Detail: Das Programm zeigt bereits vor dem Download farblich an, ob ein Modell vollständig in den Grafikspeicher passt, teilweise ausgelagert werden muss oder gar nicht startet. Zusätzlich lassen sich Dokumente als Anhang in den Chat ziehen, Werkzeuge/Agent-Funktionen sind integriert, und ein lokaler Server kann das laufende Modell im OpenAI-Format für andere Programme bereitstellen.

Ollama: schlankes Setup für Bastler

Ollama reduziert lokale KI auf das Wesentliche. Bedient wird es klassisch über die Kommandozeile, inzwischen gibt es aber auch ein einfaches Chatfenster. Mit einem Startbefehl kann man ein Modell aus einer kuratierten Bibliothek laden und sofort verwenden.

Seine Stärke liegt als Unterbau: etwa für eine Browser-Oberfläche namens Open WebUI im Heimnetz oder für Automationen über Schnittstellen.

ComfyUI: Standard für lokale Bild- und Videogenerierung

ComfyUI hat sich als Standard für lokale Bild- und Videogenerierung etabliert. Statt eines simplen Eingabefelds bietet es einen Editor, in dem einzelne Bausteine (“Nodes”) zu Workflows verbunden werden. Dank Vorlagen kommen viele Ergebnisse schnell zustande, auch wenn das Interface am Anfang komplex wirkt.

Unterstützt werden relevante Modelle von Stable Diffusion XL über Flux bis Qwen-Image sowie Videogeneratoren wie Wan. Die Software läuft auf GeForce- und Radeon-Grafikkarten; für Radeon gab es seit Anfang 2026 einen komfortablen Windows-Installer. Wer es noch einfacher möchte, kann laut Guide auch AMDs Gratis-App Amuse nutzen, über die bereits berichtet wurde.

Welche Modelle lohnen sich zum Start – und welche Anforderungen kommen danach

Als erstes lokales Sprachmodell empfiehlt der Guide derzeit GPT-OSS-20B von OpenAI. Es läuft flüssig auf den empfohlenen 16-GiB-Grafikkarten und soll in etwa das Niveau des Cloud-Modells o3-mini erreichen. Dahinter steckt das Prinzip “Mixture of Experts” (MoE): Von insgesamt 21 Milliarden Parametern werden pro Wortfragment nur 3,6 Milliarden aktiv, was Speicherbedarf und Tempo verbessert.

Googles Gemma 4 deckt laut Guide vom sparsamen Ableger für ältere GPUs bis hin zum multimodalen 26-Milliarden-Modell die Bandbreite ab und gilt als besonders stark in deutscher Sprache.

Alibabas Qwen3.6-35B-A3B wird als Allrounder für die 24-GiB-Klasse eingeordnet: Text und Bilder sind möglich, und mit Qwen3-Coder soll es eine der besten lokalen Programmierhilfen bieten.

Wer große “Agent”-Aufgaben oder Bildverständnis testen will, findet Muse Glimmer 30B von Meta im Fokus, während Nemotron 3.5 Lightning von Nvidia als weiteres Beispiel genannt wird. In der Oberliga ab etwa 60 GiB Speicher nennt der Guide außerdem GPT-OSS-120B und Mistral Small 4 als Kandidaten, die bereits an Cloud-Qualität kratzen.

Bei Bildmodellen startet der Guide mit Stable Diffusion XL als Einstiegsweg. “Flux.2 klein” liefert unter freier Apache-Lizenz in gut einer Sekunde fotorealistische Ergebnisse, während Qwen-Image als Spezialist für lesbare Schrift genannt wird. Trotzdem bleibe die wichtigste Frage immer: Passt das Wunschmodell in den vorhandenen Speicher?

Die genannten Modelle stehen kostenlos bei Hugging Face oder direkt in den Bibliotheken von LM Studio und Ollama zum Download bereit.

Drei Etappen zum eigenen Setup: schnell probieren, dann nachjustieren

Der schnellste Weg zur ersten lokalen KI führt über LM Studio und den Download eines kompakten Modells, das die Software anhand der erkannten Hardware vorschlägt. Etappe eins ist damit in etwa in einer Viertelstunde erledigt: installieren, Vorschlag laden, im Chat testen, ob Tempo und Antwortqualität passen.

Etappe zwei ist Feintuning: größere Modelle in der üblichen Q4-Quantisierung testen, bis die Speicheranzeige des Programms in den roten Bereich rutscht. Dabei soll auch die Kontextlänge im Blick behalten werden, weil sie ebenfalls VRAM frisst.

Etappe drei bringt das Setup in die Praxis: ComfyUI für Bildgenerierung, Ollama als Unterbau fürs Heimnetz oder ein erster Versuch mit angehängten Dokumenten. Wenn ein Modell nicht überzeugt, kostet der Wechsel nicht wie beim Abo Zeit und Kündigungsstress, sondern nur Downloadzeit.

Update aus der Community: neues Modell, Debatte um Ollama und Praxis-Tipps

Das Grundlagenmaterial erhielt laut Redaktion innerhalb von zwei Tagen im PCGH-Extreme-Forum sehr viel fundiertes Feedback. Das Update bündelt Hinweise und Praxiserfahrungen aus der Community und ergänzt den ursprünglichen Guide um zusätzliche Setups und Beobachtungen.

Qwen3.8-27B kommt: Apache-2.0, 14. August, starkes Interesse

Ein zentraler Community-Hinweis: Alibaba veröffentlichte am 14. August Qwen3.8-27B unter der freien Apache-2.0-Lizenz. Ein Forenbeitrag nennt das Modell nach Tests in vielen Disziplinen “auf Augenhöhe” mit aktuellen Cloud-Spitzenmodellen.

Mehr als drei Millionen Downloads allein am Startwochenende werden als Zeichen der Nachfrage genannt. Das multimodale Modell wird mit einem 256K-Kontextfenster beworben, in Q4-Quantisierung belegt die Datei rund 17 GiB, sodass es komfortabel auf 24-GiB-Karten läuft – etwa auf einer betagten GeForce RTX 3090. Komprimiertere Varianten sollen bei etwa 9 GiB beginnen.

Als Besonderheit gilt: Qwen3.8-27B ist ein dichtes Modell, bei dem stets alle Parameter aktiv rechnen. Das kann die Qualität pro Parameter erhöhen, macht aber Auslagerung in den Arbeitsspeicher spürbar teurer. Der Download ist laut Guide bei Hugging Face sowie in LM Studio und Ollama verfügbar.

Ollama-Debatte: Unterscheidung zwischen quelloffenem Kern und Desktop-App

Mehrere Community-Stimmen kritisieren Ollama. Dabei wird eine wichtige Präzisierung genannt: Quelloffen sei der Kern des Tools, die neue Desktop-App dagegen nicht.

Zusätzlich wird die Finanzierung durch Risikokapital kritisiert sowie der Umgang mit der Namensnennung von llama.cpp, dessen Technik unter der Haube arbeitet. In der Szene um r/LocalLLaMA soll diese Debatte seit Monaten geführt werden.

Als Empfehlung bleibt LM Studio der bequemste Einstieg, anschließend soll man für tieferen Einsatz direkt zu llama.cpp wechseln. Das quelloffene Original wird seit Februar 2026 unter dem Dach von Hugging Face weiterentwickelt und bringt mit “llama serve” inzwischen einen eigenen Server samt Weboberfläche. Für Agentenaufgaben wird außerdem der Hermes Agent von Nous Research empfohlen.

Hermes ist laut Guide im Februar 2026 unter MIT-Lizenz erschienen, verbindet sich mit jedem lokalen Modell und soll komplexe Aufgaben nach Erfahrung des Community-Mitglieds autonom und zuverlässig erledigen. Dabei legt er wiederverwendbare Fähigkeiten an.

Speicherreserve einplanen, mehrere GPUs kombinieren

Ein weiterer Praxispunkt warnt vor Fehlkäufen: Windows, Browser und Hintergrundprogramme belegen nach dem Start bereits rund 1,5 GiB VRAM. Dieser Teil fehlt dann beim Budget für das eigentliche Modell.

Im Beispiel-Aufbau greift ein Hermes Agent über das Netzwerk auf den LM-Studio-Server zu. Bei 16,8 GiB VRAM-Auslastung laufen Anfragen flott, und wenn die Grenze nur um wenige GiB überschritten wird, sinkt das Tempo drastisch – passend zur Bandbreitenlogik aus dem Hardware-Kapitel.

Auslagerung in den Arbeitsspeicher wird dabei als Notbehelf eingeordnet, nicht als Ersatz für VRAM. Ein weiteres Detail: LM Studio starte ein konfiguriertes Modell automatisch, sobald ein Agent darauf zugreift. GPT-OSS-20B soll darüber hinaus mehrere Anfragen parallel verarbeiten.

Zur Frage, ob sich VRAM mehrerer Grafikkarten bündeln lässt, gibt die Community eine klare Antwort: Ja. Software wie llama.cpp oder Ollama kann ein Modell schichtweise auf mehrere Karten verteilen. Als Beispiel werden zwei GeForce GTX 1080 Ti mit je 11 GiB genannt, die so zu nutzbaren 22 GiB werden.

Dabei wird empfohlen, Modelle nach dem MoE-Prinzip zu wählen, damit möglichst viel Rechenarbeit lokal auf den jeweiligen Karten bleibt. Zusätzlich wird der PCI-Express-Flaschenhals betont: Mit rund 15 GB/s in PCIe 3.0 ist der Bus deutlich langsamer als der Grafikspeicher (im System-Setup werden etwa 450 GB/s genannt).

Für deutlich eleganteres Zusammenschalten wird NVLink als Option genannt. Es sei bei GeForce zuletzt in der Ampere-Generation verfügbar gewesen und heute eher Profi-Modellen vorbehalten. Ein Extrembeispiel aus einem Threadripper-Setup nennt 256 GiB DDR5, zwei RTX 6000 Pro, eine RTX 5090 sowie sechs RTX 3090 in NVLink-Paaren – der Betrieb sei im Sommer nur noch mit Klimaanlage sinnvoll.

Benchmark-Regeln: Harness, Zeitverfall und der Blick auf Halluzinationen

Wer Modelle selbst vergleicht, bekommt Hinweise, wie man Benchmarks sinnvoll liest. Community-Stimmen nennen als Anlaufstellen die Seite von Artificial Analysis sowie das Reddit-Forum r/LocalLLaMA. Dabei sei entscheidend, dass Benchmark-Ergebnisse stark von der Testumgebung (“Harness”) abhängen.

Außerdem verlieren Ergebnisse, die älter als zwei bis drei Monate sind, erfahrungsgemäß an Aussagekraft, weil sie in den Trainingsdaten neuer Modelle “versickern” können. Deshalb lohnt auch ein Blick auf die Halluzinationsrate statt nur auf die reine Intelligenzkennzahl.

Für die Zukunft wird zudem eine Entwicklung erwartet, die eher weg von “einem einzigen großen Modell” hin zu mehreren spezialisierten Modulen führt – ähnlich wie früh in der 2D-Grafik mehrere Techniken zusammenkamen. Die Grundlagen, die der Guide liefert, bleiben dabei der Startpunkt, um lokal zu experimentieren.

  • Für erste lokale KI-Experimente reichen teils bereits GPUs mit 8 GiB VRAM, während 16 GiB deutlich mehr Auswahl erlauben.
  • Beim Kauf sollte vor allem auf den VRAM geachtet werden, weil die VRAM-Kapazität meist stärker über nutzbare Modellgrößen entscheidet als die rohe Rechenleistung.
  • Wer sensible Dokumente oder persönliche Daten verarbeitet, kann Eingaben auf dem eigenen PC halten und lokale KI auch ohne Internet nutzen.
  • Spieler und Technikfans können gegenüber Cloud-Abos Abstriche bei komplexen Aufgaben und tagesaktuellem Wissen hinnehmen, dafür aber ohne Abo-Logik experimentieren.
  • Wer kommerziell arbeiten will, sollte die jeweilige Modelllizenz prüfen: Nicht alle frei verfügbaren Modelle sind automatisch uneingeschränkt geschäftlich nutzbar.

Marcus Chen is a gaming journalist and industry reporter with more than 10 years of experience. He covers releases, announcements, and trends across PC, PlayStation, Xbox, and Nintendo, and keeps a close eye on the indie scene and esports. Previously an editor at several gaming publications, he now writes news, reviews, and breakdowns of major industry moments—from big showcases to updates on popular titles. His work is aimed at players who want a clear, fast read on what happened and why it matters.