{"id":316,"date":"2026-09-16T07:06:49","date_gmt":"2026-09-16T07:06:49","guid":{"rendered":"https:\/\/wordpress-mcp.blickpuls.de\/?p=316"},"modified":"2026-09-16T07:10:55","modified_gmt":"2026-09-16T07:10:55","slug":"gemma-4-26b-geheimer-gewinner-moe","status":"publish","type":"post","link":"https:\/\/wordpress-mcp.blickpuls.de\/?p=316","title":{"rendered":"Gemma 4 26B: Der geheime Gewinner \u2014 warum MoE auf Apple Silicon alles ver\u00e4ndert"},"content":{"rendered":"<div class=\"et_d4_element et_pb_section et_pb_section_0 article-page  et_pb_css_mix_blend_mode et_section_regular et_block_section\" >\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_d4_element et_pb_row et_pb_row_0  et_pb_css_mix_blend_mode et_block_row\">\n\t\t\t\t<div class=\"et_d4_element et_pb_column_4_4 et_pb_column et_pb_column_0  et_pb_css_mix_blend_mode et-last-child et_block_column\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_module et_d4_element et_pb_code et_pb_code_0\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_code_inner\"><a href=\"https:\/\/wordpress-mcp.blickpuls.de\/?page_id=105\" class=\"article-back reveal\">\u2190 Zur\u00fcck zum Journal<\/a><\/div>\n\t\t\t<\/div><div class=\"et_pb_module et_d4_element et_pb_code et_pb_code_1\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_code_inner\"><div class=\"article-meta reveal\"> <span class=\"cat\">Tech<\/span> <span class=\"date\">9. Juni 2026 \u00b7 9 Min. Lesezeit<\/span> <\/div><\/div>\n\t\t\t<\/div><div class=\"et_pb_module et_d4_element et_pb_text et_pb_text_0  et_pb_text_align_left et_pb_bg_layout_light\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_text_inner\"><h1 data-words>Gemma 4 26B: Der geheime Gewinner \u2014 warum MoE auf Apple Silicon alles ver\u00e4ndert<\/h1><\/div>\n\t\t\t<\/div><div class=\"et_pb_module et_d4_element et_pb_text et_pb_text_1  et_pb_text_align_left et_pb_bg_layout_light\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_text_inner\"><p class=\"article-lead reveal d1\">Alle reden \u00fcber Gemma 4 12B. Verst\u00e4ndlich \u2014 es ist kompakt, multimodal, l\u00e4uft auf jedem Mac. Aber der eigentliche Star der Gemma-4-Familie fliegt unter dem Radar: Gemma 4 26B MoE. Wir lassen es seit Tagen auf unserem Mac Studio M4 Max laufen. Das Ergebnis: fast 100 Tokens pro Sekunde. Dauerhaft. Das ist absurd gut.<\/p><\/div>\n\t\t\t<\/div><div class=\"et_pb_module et_d4_element et_pb_code et_pb_code_2\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_code_inner\"><div class=\"article-hero-img reveal d2\"> <img decoding=\"async\" src=\"\/images\/gemma-4-12b.webp\" alt=\"Gemma 4 26B MoE \u2014 Mixture of Experts auf Apple Silicon\" loading=\"eager\"> <\/div><\/div>\n\t\t\t<\/div><div class=\"et_pb_module et_d4_element et_pb_code et_pb_code_3\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_code_inner\"><div class=\"article-author-box reveal d3\"> <span class=\"av\">SK<\/span> <div class=\"author-info\"> <span class=\"author-name\">Samuel Kumanan<\/span> <span class=\"author-role\">Gr\u00fcnder & Gesch\u00e4ftsf\u00fchrer<\/span> <\/div><\/div><\/div>\n\t\t\t<\/div><div class=\"et_pb_module et_d4_element et_pb_text et_pb_text_2 article-body  et_pb_text_align_left et_pb_bg_layout_light\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_text_inner\"><p>In der KI-Szene gibt es ein Muster: wenn Google ein neues Modell ver\u00f6ffentlicht, dominiert die kleinste Variante die Diskussion. Bei Gemma 4 war es das 12B-Modell \u2014 kompakt, multimodal, perfekt f\u00fcr Apple Silicon. Wir haben selbst <a href=\"https:\/\/wordpress-mcp.blickpuls.de\/?page_id=105\" style=\"color:#F5D116;text-decoration:underline\">ausf\u00fchrlich dar\u00fcber geschrieben<\/a>. Aber w\u00e4hrend alle \u00fcber das 12B reden, haben wir still und leise das 26B MoE-Modell auf unserem Mac Studio M4 Max installiert. Und was wir sehen, hat unsere Erwartungen komplett \u00fcbertroffen.<\/p>\n<h2 class=\"reveal\">Was Gemma 4 26B MoE anders macht<\/h2>\n<p>MoE steht f\u00fcr Mixture of Experts \u2014 und es ist nicht einfach nur ein Marketing-Label. Es beschreibt eine fundamental andere Architektur. Gemma 4 26B MoE hat 26 Milliarden Parameter insgesamt, aber nicht alle sind gleichzeitig aktiv. Bei jeder Anfrage werden nur die relevanten \"Experten-Module\" aktiviert \u2014 typischerweise rund 8 Milliarden Parameter pro Inferenz-Durchlauf.<\/p>\n<p>Was das konkret bedeutet: du bekommst die Qualit\u00e4t eines 26B-Modells, aber die Geschwindigkeit und den RAM-Bedarf eines deutlich kleineren Modells. Das klingt zu gut, um wahr zu sein. Ist es aber nicht \u2014 die Mathematik dahinter ist elegant und erprobt.<\/p>\n<p>Um den Unterschied zu verstehen, muss man Dense-Modelle von MoE-Modellen unterscheiden. Ein Dense-Modell wie Llama 70B nutzt bei jeder Anfrage ALLE seine Parameter. Jede Frage, egal wie simpel, aktiviert das gesamte Netzwerk. Das braucht entsprechend mehr RAM und mehr Compute. Ein MoE-Modell ist intelligenter: es hat spezialisierte Sub-Netzwerke \u2014 die \"Experten\" \u2014 und ein Router-Netzwerk, das bei jeder Anfrage entscheidet, welche Experten die Antwort am besten liefern k\u00f6nnen.<\/p>\n<blockquote class=\"reveal\">\n<p>MoE ist wie ein Team von Spezialisten. Statt dass alle an jeder Frage arbeiten, springt nur der Experte ein, der die Antwort kennt.<\/p>\n<\/blockquote>\n<p>Das Ergebnis: ein Modell mit 26 Milliarden Parametern Gesamtwissen, das bei der Inferenz aber nur den Compute-Aufwand von circa 8 Milliarden Parametern hat. Weniger aktive Parameter bedeuten weniger Rechenoperationen pro Token, und das bedeutet: drastisch h\u00f6here Geschwindigkeit bei gleichzeitig besserer Qualit\u00e4t als ein echtes 8B-Modell.<\/p>\n<h2 class=\"reveal\">Unsere Benchmarks auf dem Mac Studio M4 Max<\/h2>\n<p>Theorie ist sch\u00f6n. Praxis ist besser. Hier sind unsere Zahlen nach mehreren Tagen Dauereinsatz:<\/p>\n<p><strong>Hardware:<\/strong> Mac Studio M4 Max, 64 GB Unified Memory<br \/> <strong>Runtime:<\/strong> Ollama, GGUF-Quantisierung (Q4_K_M)<br \/> <strong>Kontext:<\/strong> Standard-Prompts, Alltagsaufgaben, kein Cherry-Picking<\/p>\n<p><strong>Gemma 4 26B MoE:<\/strong> 95\u2013100 Tokens pro Sekunde bei Textgenerierung. Dauerhaft, stabil, kein Throttling. Auch nach Stunden gleichbleibende Performance.<\/p>\n<p>Zum Vergleich \u2014 auf demselben Mac Studio M4 Max:<\/p>\n<p><strong>Llama 3.1 70B (Q4):<\/strong> circa 12\u201315 tok\/s. Passt gerade so in 64 GB, f\u00fchlt sich aber z\u00e4h an. Jede Antwort braucht sp\u00fcrbar Zeit.<br \/> <strong>Gemma 4 12B Dense:<\/strong> circa 55\u201360 tok\/s. Schnell, aber qualitativ ein St\u00fcck unter dem 26B MoE.<br \/> <strong>Gemma 4 26B MoE (Q4_K_M):<\/strong> circa 95\u2013100 tok\/s. SCHNELLER als das kleinere Dense-Modell \u2014 bei besserer Qualit\u00e4t.<\/p>\n<p>Ja, richtig gelesen. Das 26B-Modell ist schneller als das 12B-Modell. Das ist der MoE-Effekt in Reinform: weniger aktive Parameter pro Anfrage bedeuten weniger Compute, und weniger Compute bedeutet mehr Speed. Der RAM-Verbrauch liegt bei rund 16 GB f\u00fcr die Q4-Quantisierung \u2014 das l\u00e4sst massig Platz f\u00fcr andere Anwendungen, Browser, Design-Tools, alles gleichzeitig.<\/p>\n<h2 class=\"reveal\">Qualit\u00e4t \u2014 wo steht das 26B MoE?<\/h2>\n<p>Geschwindigkeit ohne Qualit\u00e4t ist wertlos. Also haben wir das 26B MoE durch unseren t\u00e4glichen Workflow gejagt \u2014 und zwar nicht mit synthetischen Benchmarks, sondern mit echten Aufgaben aus dem Agenturalltag.<\/p>\n<p><strong>Texterstellung:<\/strong> Deutlich besser als das 12B. E-Mail-Entw\u00fcrfe, Zusammenfassungen, Briefings \u2014 das 26B MoE liefert Texte, die nah an Claude Sonnet f\u00fcr Alltagsaufgaben herankommen. Die Formulierungen sind pr\u00e4ziser, die Struktur besser, die Nuancen feiner.<\/p>\n<p><strong>Codegenerierung:<\/strong> Solide. Besser als Llama 3.1 8B, vergleichbar mit GPT-4o-mini bei Standard-Tasks. F\u00fcr schnelle Skripte, CSS-Anpassungen und Debugging-Hilfe absolut brauchbar.<\/p>\n<p><strong>Reasoning:<\/strong> \u00dcberraschend gut f\u00fcr die effektive Gr\u00f6\u00dfe. Bei logischen Aufgaben, Vergleichen und Analysen merkt man, dass hier 26 Milliarden Parameter an Wissen arbeiten \u2014 auch wenn nur ein Teil davon aktiv ist.<\/p>\n<p><strong>Multimodal:<\/strong> Bilder verstehen, Audio-Input verarbeiten \u2014 die volle Gemma-4-Palette. Ein Foto einer Whiteboard-Skizze analysieren, ein Screenshot erkl\u00e4ren lassen, Audio-Notizen transkribieren und zusammenfassen.<\/p>\n<p><strong>Schw\u00e4chen:<\/strong> Bei sehr langen, komplexen Analysen \u2014 etwa ein 20-seitiges Strategiedokument durcharbeiten oder verschachtelte Code-Refactorings planen \u2014 ist es noch unter Claude oder GPT-4o. F\u00fcr 80 Prozent der t\u00e4glichen Tasks ist das 26B MoE aber mehr als ausreichend.<\/p>\n<h2 class=\"reveal\">Warum das ein Game-Changer f\u00fcr lokale KI ist<\/h2>\n<p>Bisher gab es bei lokaler KI ein frustrierendes Dilemma: kleine Modelle sind schnell, aber nicht schlau genug. Gro\u00dfe Modelle sind schlau, aber qu\u00e4lend langsam \u2014 oder passen gar nicht erst in den RAM. Die Wahl war immer ein Kompromiss: Geschwindigkeit oder Qualit\u00e4t.<\/p>\n<p>MoE l\u00f6st dieses Dilemma. Schlau UND schnell. 26 Milliarden Parameter Wissen, 8 Milliarden Parameter Compute. Das ist nicht inkrementell besser \u2014 das ist eine neue Kategorie.<\/p>\n<p>F\u00fcr Teams, die lokal arbeiten, bedeuten 100 Tokens pro Sekunde: Echtzeit-Antworten. Kein Warten auf die Cloud, keine API-Latenz, kein \"Bitte warten Sie, Ihre Anfrage wird verarbeitet.\" Du stellst eine Frage und die Antwort erscheint, w\u00e4hrend du noch den Cursor zum n\u00e4chsten Feld bewegst.<\/p>\n<p>Und das Beste: DSGVO-konform. Keine Daten verlassen das B\u00fcro. Keine API-Keys, keine Drittanbieter-Server, keine Datenschutzerkl\u00e4rung die niemand liest. Alles lokal, alles unter deiner Kontrolle. Und trotzdem eine Qualit\u00e4t, die an GPT-4-Level heranreicht.<\/p>\n<blockquote class=\"reveal\">\n<p>100 Tokens pro Sekunde, lokal, DSGVO-konform, auf einem Mac der unter dem Schreibtisch steht. Das war vor einem Jahr undenkbar.<\/p>\n<\/blockquote>\n<h2 class=\"reveal\">Unser neues Standard-Setup<\/h2>\n<p>Nach einer Woche intensivem Testen haben wir bei BLICKPULS eine Entscheidung getroffen: Gemma 4 26B MoE ist ab sofort unser Default-Modell f\u00fcr den Alltag. Es l\u00e4uft permanent auf unserem Mac Studio M4 Max und ist \u00fcber Ollama f\u00fcr jeden im Team erreichbar.<\/p>\n<p>Die Aufgabenverteilung sieht jetzt so aus:<\/p>\n<p><strong>Gemma 4 26B MoE (lokal):<\/strong> E-Mails, Zusammenfassungen, Quick Research, Brainstorming, Code-Hilfe, Bildanalysen, Meeting-Vorbereitung \u2014 alles was schnell gehen muss und wo Privatsph\u00e4re wichtig ist.<\/p>\n<p><strong>Claude (API):<\/strong> Lange Strategiedokumente, komplexe Analysen, tiefgreifende Research-Aufgaben, alles wo maximale Reasoning-Tiefe gefragt ist. Claude bleibt unser Go-To f\u00fcr die K\u00f6nigsdisziplinen.<\/p>\n<p>Die Kombination ist unschlagbar: lokale Geschwindigkeit f\u00fcr den Alltag, Cloud-Qualit\u00e4t f\u00fcr die Spezialdisziplinen. Und das Sch\u00f6nste: wir sparen API-Kosten, weil 80 Prozent unserer Anfragen jetzt lokal laufen \u2014 schneller als \u00fcber die Cloud und ohne jede Geb\u00fchr pro Token.<\/p>\n<p>Gemma 4 26B MoE ist kein Hype-Modell. Es ist ein Arbeitstier. Und genau deshalb verdient es mehr Aufmerksamkeit.<\/p><\/div>\n\t\t\t<\/div><div class=\"et_pb_module et_d4_element et_pb_code et_pb_code_4\">\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t<div class=\"et_pb_code_inner\"><div class=\"article-cta reveal\">Sie interessieren sich f\u00fcr lokale KI-Modelle und DSGVO-konforme KI-Workflows? Lassen Sie uns reden. <a href=\"https:\/\/wordpress-mcp.blickpuls.de\/?page_id=106\" class=\"btn\">Gespr\u00e4ch vereinbaren<\/a> <\/div><\/div>\n\t\t\t<\/div>\n\t\t\t<\/div>\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t\t\n\t\t\t<\/div>\n\t\t\t\t\n\t\t\t\t\n\t\t\t<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Alle reden \u00fcber Gemma 4 12B. Verst\u00e4ndlich \u2014 es ist kompakt, multimodal, l\u00e4uft auf jedem Mac. Aber der eigentliche Star der Gemma-4-Familie fliegt unter dem Radar: Gemma 4 26B MoE. Wir lassen es seit Tagen auf unserem Mac Studio M4 Max laufen. Das Ergebnis: fast 100 Tokens pro Sekunde. Dauerhaft. Das<\/p>\n","protected":false},"author":0,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"on","_et_pb_old_content":"","_et_gb_content_width":"","footnotes":""},"categories":[4],"tags":[],"class_list":["post-316","post","type-post","status-publish","format-standard","hentry","category-tech"],"_links":{"self":[{"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=\/wp\/v2\/posts\/316","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=316"}],"version-history":[{"count":1,"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=\/wp\/v2\/posts\/316\/revisions"}],"predecessor-version":[{"id":325,"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=\/wp\/v2\/posts\/316\/revisions\/325"}],"wp:attachment":[{"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=316"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=316"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/wordpress-mcp.blickpuls.de\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=316"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}