49 Episoden
- Kimi K3 von Moonshot AI ist gerade in aller Munde. Ein Open-Weight-Modell mit 2,8 Billionen Parametern, das mit den besten Modellen aus den USA mithalten will. Aber wie installiert man eigentlich ein solches Modell selbst?
In dieser Folge nehmen wir Kimi K3 als Aufhänger, um den kompletten Prozess zu erklären: Was unterscheidet ein Open-Weight-Modell von proprietären Systemen wie ChatGPT oder Claude? Warum könnt ihr Kimi K3 selbst trotz Quantisierung nicht auf eurem Laptop laufen lassen und welche kleineren, alltagstauglichen Modelle funktionieren stattdessen?
Ich erkläre euch Hugging Face als zentrale Anlaufstelle für Open-Weight-Modelle, erkläre die wichtigsten Dateiformate GGUF und Safetensors, und stellen die drei populärsten Tools für den lokalen Betrieb vor: Ollama, LM Studio und Open WebUI.
Diese Folge baut auf unseren vorherigen Episoden zu Quantisierung und Speicherarten (VRAM, RAM, Unified Memory) auf und liefert den praktischen Einstieg zum Selbermachen.
Themen: Kimi K3, Moonshot AI, Open-Weight-Modelle, Hugging Face, GGUF, Ollama, LM Studio, lokale LLMs, KI selbst hosten
Links:
- Erklärung GGUF: https://huggingface.co/docs/hub/gguf
- Erklärung Safe Tensors:
https://huggingface.co/docs/safetensors/index
- Kimi K3 auf Hugging Face: https://huggingface.co/moonshotai/Kimi-K3
- Open WebUI: https://docs.openwebui.com/
- Ollama: https://ollama.com/
- LM Studio: https://lmstudio.ai/ - Sollte euer Unternehmen KI-Modelle selbst hosten oder aus der Cloud mieten. Und was hat der US Cloud Act damit zu tun?
In dieser Folge von "KI kurz und informativ" schliessen wir unsere Mini-Serie zu Hardware und Hosting von KI-Modellen ab. Wir vergleichen On-Premise-Betrieb und Cloud-Computing anhand der vier klassischen Abwägungspunkte: Kosten, Kontrolle, Skalierung und Beschaffung.
Ausserdem schauen wir uns an, warum ein Serverstandort in Frankfurt oder Amsterdam allein noch keine Garantie für europäisches Recht ist und was der US CLOUD Act damit zu tun hat. Neben den vier genannten Kriterien ist Datensouveränität ebenso eine zentrale Grösse, die sich schwer in Geld bemessen lässt.
Diese Folge baut auf unseren letzten beiden Episoden zu Quantisierung und Speicherarten (VRAM, RAM, Unified Memory).
Quellen:
- Microsoft kann keine Datensouveränität garantieren: https://www.forbes.com/sites/emmawoollacott/2025/07/22/microsoft-cant-keep-eu-data-safe-from-us-authorities/
- US Cloud Act: https://www.digital-chiefs.de/eu-tech-sovereignty-paket-cloud-souveraenitaet-vorstand-cloud-act-dach/
- Hyperscaler Marktanteile: https://www.itreseller.ch/Artikel/104615/Hyperscaler-Kapazitaet_hat_sich_mehr_als_vervierfacht.html (ältere Zahlen aus Jan. 2026) - Speicher ist nicht gleich Speicher. Wie viel Arbeitsspeicher braucht ein LLM wirklich? Warum reicht es nicht aus, einfach mehr "Speicher zu kaufen"?
In dieser Folge von "KI kurz und informativ" schauen wir uns die drei physischen Speicherebenen im PC oder Server an: VRAM (Grafikkarte), RAM (Arbeitsspeicher) und Massenspeicher (SSD/HDD). Ausserdem erklären wir, was Apple mit seinen M-Chips und dem sog. "Unified Memory" anders macht als klassiche Windows-PCs mit dedizierter Grafikkarte, warum die aktuellen RAM-Preissteigerungen direkt mit dem KI-Boom zusammenhängen, und wieso Kontextlänge (KV-Cache) und Nutzerzahl (Concurrency) den Speicherbedarf in der Praxis zusätzlich in die Höhe treiben.
Diese Folge baut auf unserer letzten Episode zu Quantisierung auf und bereitet den Boden für die nächste Folge: Cloud vs. On-Premise-Hosting von KI-Modellen aus Business-Sicht.
Quellen:
Apple M7 im Tapeout: https://www.heise.de/news/M-Chips-M7-mit-bis-zu-1-5-TByte-und-warum-Apple-den-M6-ueberspringt-11362052.html - Large Language Models (LLMs) wie GPT auf dem eigenen PC oder Smartphone laufen lassen? Ja, das geht!
Quantisierung ist eine Schlüsseltechnik, mit der das funktioniert. Damit können riesige KI-Modelle drastisch verkleinern lassen, ohne dabei komplett auf Qualität zu verzichten.
Du erfährst in der Folge:
Warum LLMs so viel Speicherplatz brauchen (und was FP32, FP16 und INT8 damit zu tun haben).
Wie Quantisierung den Speicherbedarf eines Modells
reduziert.
Was die Vor- und Nachteile sind und wie du dank Quantisierung, ein LLM theoretisch lokal auf deinem PC, Mac oder Home-Server betreiben könntest. - „Wissen ins Unternehmen bringen" ist schon die falsche Formulierung, denn Wissen ist kein Paket, das man einkauft und ins Regal stellt.
In dieser Folge geht es darum, wie ihr KI-Kompetenz wirklich intern aufbaut. Wir schauen uns die drei üblichen Wege an: Einkauf, Lernplattformen und die isolierte KI-Abteilung und warum sie für sich genommen selten reichen.
Wir schauen uns Ansatz gezielt an, erötern die Vor- und Nachteile und ich erkläre, was ich in der letzten Folge mit dem Sprichwort über den Fisch meinte.
("Gib einem Mann einen Fisch und er ernährt sich einen Tag. Zeig dem Mann wie man fischt und er ernährt sich sein Leben lang.")
Das heisst, dass ihr euch die Frage jedes Mal stellen solltet, wenn ihr externe Hilfe zu Rate zieht: Verkauft mir jemand gerade einen Fisch oder zeigt er mir das Fischen?
Quellen:
https://www.datacamp.com/blog/the-state-of-data-and-ai-literacy-in-2026-definitions-statistics-and-the-ai-skills-gap
Links:
Folge über KI-Jobrollen: https://open.spotify.com/episode/1f4cAqCJhRU1eT8CYxZ5cS?si=RkAdQfwZTdeTZxbASfaSEg
Letzte Folge über KI-Einführung im Unternehmen: https://open.spotify.com/episode/2ZAWIVLmuE0podQArCKwAo?si=mQpXtTAaShizR887T5n9hQ
Weitere Bildung Podcasts
Trending Bildung Podcasts
Über KI - kurz und informativ, Klartext "to Go" in unter 5 Minuten
"KI - kurz und informativ" erklärt Künstliche Intelligenz verständlich, kompakt und ohne Fachchinesisch. In weniger als 5 Minuten erfahrt ihr als Entscheider in Wirtschaft und Verwaltung, worum es eigentlich wirklich geht - ohne Hype von den Grundlagen, über Anwendungen im Unternehmen bis hin zu den neusten Entwicklungen.
Was ist ein Large Language Model (LLM)? Was sind neuronale Netze? Welche Datenschutzanforderungen muss ich beachten? EU AI Act? Wie bereite ich meine Daten auf? All das und vieles mehr sind Themen unserer Podcast-Reihe. Viel Spaß beim Zuhören!
Podcast-WebsiteHöre KI - kurz und informativ, Klartext "to Go" in unter 5 Minuten, {ungeskriptet} - Der Meinungsfreiheit verpflichtet. und viele andere Podcasts aus aller Welt mit der radio.de-App

Hol dir die kostenlose radio.de App
- Sender und Podcasts favorisieren
- Streamen via Wifi oder Bluetooth
- Unterstützt Carplay & Android Auto
- viele weitere App Funktionen
Hol dir die kostenlose radio.de App
- Sender und Podcasts favorisieren
- Streamen via Wifi oder Bluetooth
- Unterstützt Carplay & Android Auto
- viele weitere App Funktionen


KI - kurz und informativ, Klartext "to Go" in unter 5 Minuten
Code scannen,
App laden,
loshören.
App laden,
loshören.




























