Elf Tage, drei Releases: Am 3. August 2026 hat Alibaba sein bisher größtes KI-Modell Qwen3.8-Max gelauncht, am 12. August die Gewichte des 2,4-Billionen-Parameter-Flaggschiffs veröffentlicht – und am 14. August Qwen3.8-27B unter Apache-2.0-Lizenz nachgelegt: ein Modell, das du kostenlos herunterladen, verändern und auch kommerziell auf eigener Hardware betreiben darfst. Hier bekommst du den Überblick über alle drei Releases, eine ehrliche Einordnung gegenüber den Frontier-Modellen – und was die Open-Source-Welle für deine KI-Skills bedeutet. Stand: August 2026.
Qwen in 60 Sekunden: die meistgeladene offene Modellfamilie der Welt
Qwen ist die KI-Modellfamilie von Alibaba, entwickelt vom hauseigenen Tongyi Lab – und gemessen an Downloads die meistgeladene offene Modellfamilie der Welt: Mitte August 2026 meldete Alibaba über drei Milliarden Downloads und zog damit an Metas Llama- und Googles Gemma-Modellen vorbei. Der Grund: Anders als OpenAI oder Anthropic stellt Alibaba seit 2023 viele seiner Sprach- und multimodalen Modelle mit offenen Gewichten ins Netz – jeder kann sie herunterladen, anpassen und selbst betreiben.
Die Dominanz bestätigt auch Hugging Face: Der „State of Open Models“-Bericht (Sommer 2026) zählt allein für dieses Jahr rund zwei Milliarden Qwen-Downloads – mehr als dreimal so viele wie für Google- und Meta-Modelle zusammen – und über 150.000 Qwen-Ableger von Drittentwicklern auf der Plattform.
Warum das relevant ist: Offene Gewichte sind das Fundament, auf dem andere bauen – Startups, Forschung, Unternehmens-IT. Wer heute ein KI-Produkt ohne API-Abhängigkeit entwickelt, landet oft bei einem Qwen-Derivat.

Die drei Qwen-3.8-Releases im Überblick
Innerhalb von elf Tagen hat Alibaba drei Varianten der 3.8-Generation veröffentlicht – mit sehr unterschiedlichen Bedingungen. Die wichtigsten Eckdaten (alle Angaben laut Alibaba bzw. den offiziellen Modellkarten, Stand: August 2026):
| Modell | Größe | Lizenz | Zugang | Für wen |
|---|---|---|---|---|
| Qwen3.8-Max (3. Aug.) | 2,4 Bio. Parameter (MoE, ~95 Mrd. aktiv), multimodal, 1 Mio. Token Kontext | proprietär – nur per API | Alibaba Cloud API: 2 $ / 6 $ pro Mio. Input-/Output-Token | Teams, die Qwen im Maximalausbau per API nutzen wollen |
| Qwen3.8-2.4T-A95B (12. Aug.) | 2,4 Bio. Parameter (MoE, 95 Mrd. aktiv), nur Text, 262k Token Kontext | eigene „qwen3.8-max“-Lizenz – kein Apache 2.0 | Download (Hugging Face); braucht Multi-GPU-Server | Forschung und Unternehmen mit eigener KI-Infrastruktur |
| Qwen3.8-27B (14. Aug.) | 27,8 Mrd. Parameter (dense), multimodal, 262k Token Kontext | Apache 2.0 – kommerziell frei nutzbar | Download (Hugging Face); quantisiert ab einer 24-GB-GPU | Entwickler, Mittelstand, Lernende – der lokale Allrounder |
Bemerkenswert ist vor allem die mittlere Zeile: Zum ersten Mal hat Alibaba die Gewichte eines Modells der Max-Klasse veröffentlicht, statt das Flaggschiff hinter der API zu halten. Die offene Variante ist gegenüber der API abgespeckt – nur Text statt multimodal, 262.144 statt einer Million Token Kontext.
Wichtig
„Open Weights“ heißt nicht automatisch „frei nutzbar“. Das große Qwen3.8-2.4T-A95B steht unter einer eigens geschriebenen „Qwen3.8-Max“-Lizenz – unabhängige Lizenz-Analysen (u. a. InsiderLLM) beschreiben darin eine Umsatzschwelle von 50 Mio. $ für Model-as-a-Service- und KI-Assistenz-Geschäftsmodelle sowie eine Namensnennungspflicht ab 100 Mio. monatlichen Nutzern. Wer kommerziell darauf bauen will, muss die Lizenzdatei selbst prüfen, statt Apache-Bedingungen anzunehmen. Nur das 27B-Modell trägt die echte Apache-2.0-Lizenz.
Warum das 27B-Release die eigentliche Nachricht ist
Das Schlagzeilen-Modell ist Qwen3.8-Max – praktisch relevant für die meisten ist aber Qwen3.8-27B. Die Community hat das schnell erkannt: Binnen drei Tagen nach Release zählte das Modell laut Tech-Portal Cybernews über drei Millionen Downloads auf Hugging Face. Drei Gründe, warum:
1. Apache 2.0 ist so frei, wie Lizenzen werden. Kommerzielle Nutzung, Veränderung, Weiterverbreitung – alles erlaubt, ohne Umsatzschwellen, Nutzerlimits oder Rückfragen beim Hersteller. Für Unternehmen ist das der Unterschied zwischen „interessantes Forschungsobjekt“ und „darf in unser Produkt“.
2. Es läuft auf erreichbarer Hardware. In voller Präzision braucht das Modell laut ersten unabhängigen Analysen noch Profi-Hardware der 80-GB-Klasse – in komprimierter (quantisierter) 4-Bit-Form schrumpft es aber auf rund 17 GB und läuft damit auf einer einzelnen Grafikkarte mit 24 GB Speicher. Das ist Workstation-Niveau, kein Rechenzentrum. Dazu ist es multimodal: Es verarbeitet Text, Bilder und Video als Eingabe.
3. Lokal heißt: Deine Daten bleiben bei dir. Ein Modell, das auf eigener Hardware läuft, schickt keine Kundendaten, Verträge oder Patientenakten an einen Cloud-Anbieter – weder in die USA noch nach China. Für deutsche Unternehmen, die KI-Nutzung bisher am Datenschutz scheitern sahen, kann das die entscheidende Tür sein.
Gut zu wissen
Ein lokales Modell kann die DSGVO-Bewertung deutlich vereinfachen, weil keine Daten an Dritte fließen – es macht einen Einsatz aber nicht automatisch konform. Rechtsgrundlage der Verarbeitung, Betroffenenrechte und interne Zugriffskontrollen gelten weiter und hängen vom konkreten Einsatz ab. Das ist eine Einschätzung, keine Rechtsberatung.
Durchgespielt: was ein Mittelständler damit heute anfangen kann. Nimm eine Hausverwaltung mit 20 Mitarbeitenden. Täglich kommen Schadensmeldungen, Mieteranfragen und gescannte Rechnungen herein – voller personenbezogener Daten, die nicht in eine US- oder China-Cloud dürfen. Weil Qwen3.8-27B multimodal ist, kann eine einzelne Workstation mit 24-GB-Grafikkarte im Haus solche Dokumente lesen, zusammenfassen, nach Dringlichkeit sortieren und Antwortentwürfe vorformulieren – ohne dass ein Byte das Firmennetz verlässt. Dieselbe Mechanik lässt sich auf Arztpraxen, Kanzleien oder Personalabteilungen übertragen. Zwei Dinge gehören allerdings dazu: jemand, der das System aufsetzt und betreut – und ein Team, das damit umgehen kann. Wer KI so in den Betrieb holt, muss Mitarbeitende ohnehin qualifizieren (Stichwort KI-Schulungspflicht nach Art. 4 AI Act); wie du das systematisch aufziehst, zeigt der Guide Mitarbeiterschulung.
Ehrliche Einordnung: Wo Qwen 3.8 wirklich steht
Die Kurzfassung, Stand August 2026: Qwen 3.8 verkleinert den Abstand zur Spitze weiter, ersetzt sie aber nicht – und fast alle Leistungszahlen stammen bisher vom Hersteller selbst. Alibaba gibt an, dass Qwen3.8-Max in den Community-Rankings Platz fünf der Text Arena und Platz zwei der Vision Arena erreicht, und positioniert das Modell per interner Auswertung direkt hinter dem Frontier-Spitzenreiter – beides ohne unabhängige Bestätigung zum Launch.
Für Qwen3.8-27B nennt Alibabas eigene Benchmark-Tabelle unter anderem 73,0 Punkte auf Terminal-Bench 2.1 (Vorgänger Qwen3.6: 63,4) und 61,7 auf SWE-bench Pro (vorher 53,5) – deutliche Sprünge, aber eben selbst gemessen. Erste unabhängige Analysen (u. a. Kingy AI, Local AI Zone) bestätigen die Richtung, sehen die aktuellen Frontier-Modelle von OpenAI und Anthropic bei besonders schweren Aufgaben aber weiterhin vorn. Die oft zitierte Formel, das 27B-Modell spiele „mit Modellen der 10- bis 15-fachen Größe mit“, ist Launch-Marketing – plausibel im Trend, unbewiesen im Detail.
Die eigentliche Stärke liegt also woanders: im Preis-Leistungs-Verhältnis der API – und in der Freiheit, das 27B-Modell überall dort einzusetzen, wo API-Modelle aus Kosten- oder Datenschutzgründen ausscheiden. Womit wir bei den Zahlen wären.
Was kostet Qwen? API und lokaler Betrieb im Vergleich
Qwen3.8-Max kostet über die API 2 $ pro Million Input- und 6 $ pro Million Output-Token – laut Alibabas Preisliste einheitlich über das gesamte Kontextfenster; wiederholte Eingaben verbilligt ein automatischer Cache auf 0,25 $ pro Million Token (Stand: August 2026, kein Gratis-Kontingent). Qwen3.8-27B kostet keine Lizenzgebühren – du zahlst Hardware, Strom und die Zeit, das System zu betreiben.
Rechenbeispiel
Ein interner Assistent beantwortet 1.000 Anfragen pro Arbeitstag, jede mit rund 2.000 Input- und 500 Output-Token. Über die Max-API: 2 Mio. Input-Token (4 $) plus 0,5 Mio. Output-Token (3 $) = 7 $ pro Tag – bei 21 Arbeitstagen rund 150 $ im Monat. Reasoning-Modus und lange Dokumente treiben den Wert nach oben, die Größenordnung bleibt: Dutzende bis wenige hundert Dollar monatlich.
Die ehrliche Konsequenz daraus: Rein finanziell schlägt die API bei kleinen und mittleren Volumina fast immer den Eigenbetrieb, sobald man Anschaffung, Strom und Administrationszeit mitrechnet. Lokal gewinnt aus zwei anderen Gründen – wenn deine Daten den Anbieter nichts angehen dürfen (Datenschutz, Betriebsgeheimnisse) oder wenn sehr hohe, gleichmäßige Volumina die Token-Rechnung dauerhaft vierstellig machen. Wer dir „lokal = kostenlos“ verkauft, unterschlägt Hardware, Strom und Betreuung.
Wofür lokale Modelle wirklich laufen: Automatisierung im Hintergrund
Ein Missverständnis hält sich hartnäckig: dass ein lokales Modell vor allem ein Chat-Ersatz sei. In der Praxis laufen Modelle wie Qwen3.8-27B meist unsichtbar – eingebaut in automatisierte Workflows mit Werkzeugen wie n8n, Make oder eigenen Skripten. Dort erledigen sie vollautomatisch Standard-Aufgaben: eingehende E-Mails klassifizieren, Daten aus Dokumenten ziehen, Texte zusammenfassen, Antwortentwürfe vorformulieren. Für genau diese Jobs setzen viele Teams bisher kleine, günstige API-Modelle wie Claude Haiku 4.5 ein – und in dieser Leistungsklasse kann ein lokal betriebenes 27B-Modell bei vielen Standard-Aufgaben mithalten, bei voller Datenhoheit. Das ist eine Praxis-Einschätzung, kein Benchmark – was für deine Aufgaben gilt, zeigt nur der Test.
Dazu gehört eine ehrliche Tempo-Erwartung. Auf einer Workstation mit passender 24-GB-Grafikkarte liefert ein quantisiertes 27B-Modell je nach Hardware grob zweistellige Token-Raten pro Sekunde – also einige Wörter pro Sekunde. Auf kleineren Setups ohne geeignete Grafikkarte fällt das schnell in den einstelligen Bereich, und ein Prompt kann spürbar dauern. Für interaktives Chatten fühlt sich das zäher an als jeder Cloud-Dienst. Für Hintergrund-Workflows ist es meist unerheblich: Dort wartet kein Mensch auf die Antwort – es zählt, dass die Aufgaben über den Tag zuverlässig abgearbeitet werden.
Wichtig beim Umstieg: erst testen, dann umstellen
Ob das lokale Modell deine konkreten Aufgaben gut genug erledigt, entscheidet kein Ranking, sondern der Vergleichstest mit echten Fällen: dieselben 20–50 realen Aufgaben einmal durch das bisherige API-Modell und einmal durch Qwen3.8-27B schicken, Ergebnisse nebeneinanderlegen – und erst dann den Workflow umstellen.
Praktischer Einstieg: wo du Qwen ausprobieren kannst
Per API. Qwen3.8-Max läuft über Alibaba Cloud, laut Anbieter mit OpenAI- und Anthropic-kompatiblen Schnittstellen – bestehender Code lässt sich also mit wenigen Zeilen umstellen.
Lokal. Die offiziellen Gewichte von Qwen3.8-27B liegen auf Hugging Face (BF16 und FP8). Für den Einstieg auf normaler Hardware sorgt die Community: Quantisierte Versionen laufen über Tools wie Ollama oder LM Studio, für den Produktivbetrieb auf Servern gibt es Tag-1-Unterstützung in vLLM und SGLang. Die Einstiegshürde ist damit so niedrig wie nie.
Was das für dich heißt, wenn du KI lernst
Die Qwen-Releases zeigen eine Verschiebung, die gerade den Arbeitsmarkt erreicht: KI-Kompetenz heißt immer seltener „kann ChatGPT bedienen“ – und immer öfter „kann einschätzen, welches Modell zu welcher Aufgabe passt“. Darf das Tool mit Kundendaten arbeiten? Reicht ein lokales 27B-Modell, oder braucht es die Frontier-API? Was bedeutet die Lizenz für den Firmeneinsatz? Wer solche Fragen beantworten kann, ist genau das Bindeglied, das Unternehmen suchen – einen Überblick über die entstehenden Rollen gibt der Guide KI-Berufe.
Die gute Nachricht: Diese Kompetenz veraltet nicht mit dem nächsten Release. Prompting-Techniken funktionieren bei Qwen genauso wie bei ChatGPT oder Claude – wie du sie systematisch aufbaust, zeigt der Guide Prompt Engineering lernen. Und wer die Grundlagen einmal strukturiert gelernt hat, ordnet jedes neue Modell schnell ein – der Einstieg steht im Guide KI lernen. Programmierkenntnisse oder ein Technik-Studium brauchst du dafür nicht: Auch ohne Vorkenntnisse ist der Weg in die KI-Arbeit offen.
Häufige Fragen
Was ist Qwen?
Qwen ist die KI-Modellfamilie von Alibaba, entwickelt vom Tongyi Lab. Sie umfasst Sprach- und multimodale Modelle vom kleinen Spezialisten bis zum 2,4-Billionen-Parameter-Flaggschiff – viele davon mit offenen Gewichten. Mit über drei Milliarden Downloads (Herstellerangabe, Stand August 2026) ist Qwen die meistgeladene offene Modellfamilie der Welt.
Ist Qwen kostenlos?
Teilweise. Qwen3.8-27B kannst du unter Apache-2.0-Lizenz kostenlos herunterladen und auch kommerziell nutzen – du zahlst nur deine eigene Hardware oder das Hosting. Das Spitzenmodell Qwen3.8-Max gibt es dagegen nur per API, mit rund 2 $ pro Million Input- und 6 $ pro Million Output-Token (Stand: August 2026).
Läuft Qwen 3.8 auf einem normalen PC?
Qwen3.8-27B läuft in quantisierter Form (rund 17 GB) auf einer einzelnen Grafikkarte mit 24 GB Speicher – also auf einer gut ausgestatteten Workstation oder einem High-End-Gaming-PC. Das große Qwen3.8-2.4T-A95B ist dagegen nichts für Einzelrechner: Es braucht Server mit mehreren Profi-GPUs.
Ist Qwen besser als ChatGPT oder Claude?
Nach Alibabas eigenen Benchmarks liegt Qwen3.8-Max nah an der Spitze – unabhängige Bestätigung stand zum Launch aber aus. Erste externe Analysen sehen die Frontier-Modelle bei besonders schweren Aufgaben weiter vorn. Stärkstes Argument für Qwen sind der Preis und die offenen Varianten, nicht der Benchmark-Sieg.
Können deutsche Unternehmen ein chinesisches KI-Modell datenschutzkonform nutzen?
Beim lokalen Betrieb eines Open-Weights-Modells wie Qwen3.8-27B verlassen die Daten das eigene System nicht – es findet keine Übermittlung nach China oder in eine Cloud statt. Das kann die DSGVO-Bewertung deutlich vereinfachen, ersetzt aber keine Prüfung des konkreten Einsatzes. Anders bei der API: Dort verarbeitet Alibaba Cloud die Anfragen.
Was bedeutet Apache 2.0 bei einem KI-Modell?
Apache 2.0 ist eine der freiesten Software-Lizenzen: Du darfst das Modell nutzen, verändern und weiterverbreiten – auch kommerziell, ohne Gebühren oder Nutzerlimits. Bei Qwen3.8-27B gilt das für die Modellgewichte; Trainingsdaten und Trainingsrezept hat Alibaba nicht veröffentlicht.
KI-Skills systematisch lernen – gefördert
Modelle wie Qwen ändern sich im Wochentakt – die Kompetenz, mit KI zu arbeiten, bleibt. In der KI-Weiterbildung von Scaly lernst du von Grund auf, Tools wie ChatGPT, Claude oder Qwen produktiv einzusetzen – inklusive der Praxis, wie du offene Modelle installierst und in Automatisierungs-Workflows für den echten Betrieb einsetzt. Wenn du arbeitssuchend bist und die Voraussetzungen erfüllst, kann die Agentur für Arbeit die Kosten über einen Bildungsgutschein zu 100 % übernehmen. Das Erstgespräch ist kostenlos und unverbindlich.
Kostenloses Erstgespräch sichern
Benedikt Backhaus – schreibt bei Scaly über KI-Tools, neue Modelle und aktuelle Entwicklungen rund um künstliche Intelligenz. Er beobachtet die KI-Szene laufend und ordnet ein, was neue Releases praktisch bedeuten – ehrlich und ohne Hype. Einschätzung, keine Rechtsberatung. Benedikt auf LinkedIn