Free LLMs
Täglich aktualisierte Übersicht aller Modelle, die kostenlos nutzbar sind – ob Open Weight, Free API Tier oder lokal.
MAI-Transcribe 1.5
AktivMicrosoft MAI-Transcribe 1.5, kostenlos über OpenRouter
MAI-Image-2.5
AktivMicrosoft MAI-Image-2.5, kostenlos über OpenRouter
Riverflow V2.5 Pro
AktivSourceful Riverflow V2.5 Pro, kostenlos über OpenRouter
Riverflow V2.5 Fast
AktivSourceful Riverflow V2.5 Fast, kostenlos über OpenRouter
Nemotron 3.5 Content Safety (free)
AktivNVIDIA Nemotron 3.5 Content Safety, kostenlos über OpenRouter
Nemotron 3 Ultra (free)
AktivNVIDIA Nemotron 3 Ultra, 550B Parameter (55B aktiv), 1M Kontext, kostenlos über OpenRouter
Llama Nemotron Rerank VL 1B V2 (free)
AktivNVIDIA Nemotron Rerank VL 1B V2 für Multimodal-Rewriting, kostenlos über OpenRouter
Claude Fable Latest
AktivAnthropic Claude Fable Latest, kostenlos über OpenRouter
Claude Fable 5
AktivAnthropic Claude Fable 5, kostenlos über OpenRouter
Nex-N2-Pro (free)
AktivNex AGI Nex-N2-Pro, agentischer MoE mit 17B aktiven Parametern (397B gesamt), kostenlos über OpenRouter
Gemini 3.5 Flash
AktivGoogles neuestes Flash-Modell mit verbesserter Geschwindigkeit und Effizienz, optimiert für Echtzeitanwendungen.
Qwen3.7 Max
AktivAlibabas aktuelles Flaggschiff-Modell der Qwen-Reihe mit verbesserten Reasoning-Fähigkeiten und multimodaler Unterstützung.
Grok Build 0.1
AktivxAI Grok Build 0.1 ist ein frühes Entwicklungsmodell mit Fokus auf Code-Generierung und technische Problemlösung.
Kimi K2.6
AktivAktualisiert: Kimi K2.6 weiterhin kostenlos auf OpenRouter und Ollama Cloud verfügbar.
Gemma 4 31B
AktivAktualisiert: Google Gemma 4 31B weiterhin kostenlos auf OpenRouter verfügbar.
Gemma 4 26B A4B
AktivUpdate: Weiterhin kostenlos auf OpenRouter.
Nicht mehr in Quellen gefunden
MiniMax M3
AktivMiniMax M3, das neueste KI-Modell von MiniMax, bietet multimodale Fähigkeiten mit Fokus auf Text- und Bildverständnis, verfügbar auf OpenRouter zum kostenlosen Testen.
Claude Opus 4.8
AktivAnthropics leistungsstärkstes Modell mit fortschrittlichen Reasoning-Fähigkeiten, dynamischen Workflows und verbesserter Code-Generierung.
Cohere Command Light
AktivCoheres neues leichtgewichtiges Command-Modell für einfache Aufgaben mit niedrigeren Kosten, verfügbar auf Amazon Bedrock.
Fusion
AktivEin von OpenRouter bereitgestelltes kostenloses Modell, das mehrere Modelle zu einem optimierten Output kombiniert.
Gemma 4 12B
AktivGoogles neues offenes Multimodal-Modell (12B Parameter), encoder-frei, verarbeitet Text und Bild-Eingaben, gibt Text aus. Open Weight unter Apache 2.0.
Laguna XS.2
AktivKompaktes multimodales Modell aus OpenRouters Free-Collection.
Nemotron 3 Nano Omni
AktivNVIDIA Nemotron 3 Nano Omni – kostenloses multimodales Modell in OpenRouters Free Collection.
Nemotron 3 Super
AktivNVIDIA Nemotron 3 Super – kostenlose Variante in OpenRouters Free Collection.
Nemotron Nano 12B 2 VL
AktivNVIDIA Nemotron Nano 12B – kleines, kostenloses Vision-Language-Modell in OpenRouters Free Collection.
Nemotron 3 Nano 30B A3B
AktivNVIDIA Nemotron 3 Nano 30B – aktivierte Variante (30B aktiv, 3B Basis), kostenlos in OpenRouter.
Llama Nemotron Embed VL 1B V2
AktivNVIDIA Llama Nemotron Embed – kleines Vision-Language-Embedding-Modell (1B), kostenlos in OpenRouter.
LFM2.5-1.2B-Thinking
AktivKleines Denk-Modell (1.2B) aus OpenRouters Free Collection.
LFM2.5-1.2B-Instruct
AktivKleines Instruct-Modell (1.2B) aus OpenRouters Free Collection.
Nex-N2-Pro
AktivAgentisches Mixture-of-Experts-Modell von Nex AGI mit 17B aktiven Parametern (397B total). Basierend auf Qwen3.5-Architektur, unterstützt Reasoning, Function Calling, Bild+Text-Eingabe und strukturierte Ausgaben. Optimiert für Coding, Tool-Use und langfristige Agenten-Workflows. Apache 2.0 Lizenz.
Nano Banana Pro
AktivNeues Bildgenerierungs- und Editierungsmodell von Google DeepMind. Basiert auf Gemini 3 Pro. Verfügbar über Google AI Studio. Free API Tier mit Ratelimits.
Llama Nemotron Rerank VL 1B V2
AktivNVIDIAs leichtes Reranker-Modell, optimiert für Relevanz-Scoring von Textpassagen. Verfügbar auf OpenRouter mit kostenlosem API-Zugang und optimiert für RAG-Pipelines und Suchanwendungen.
Supra-50M-Reasoning
AktivExtrem kleines Reasoning-Modell (50M Parameter) von SupraLabs. Produziert vollständige Thinking-Chain vor jeder Antwort. Apache 2.0 Lizenz, läuft auf CPU. SFT auf SupraThink-Dataset-500x.
DeepSeek V4 Flash
AktivAktualisiert: DeepSeek V4 Flash weiterhin kostenlos auf OpenRouter und Ollama Cloud verfügbar.
Claude Opus 4.8 (Fast)
AktivAnthropics neuestes Spitzenmodell Claude Opus 4.8 mit schnellerer Inferenz (Fast-Variante). Unterstützt dynamische Workflows und verbesserte Code-Generierung.
Gerüchte
Claude Fable 5
Anthropic veröffentlicht Claude Fable 5 am 9. Juni 2026 — eine öffentliche Version des zuvor internen Mythos-Modells, das Videospiele generieren kann. Auf OpenRouter als 'Claude Fable Latest' und 'Claude Fable 5' gelistet, aber nicht explizit als 'free' markiert. Möglicherweise mit eingeschränktem Free-Tier.
Cohere Coding Model (unreleased)
Cohere gibt Early Access zu einem neuen, unveröffentlichten Coding-Modell auf r/LocalLLaMA bekannt. Das Modell ist ein komplett neues Pre-Trained-Modell, spezialisiert auf Code-Generierung.
Cohere BLS-Mini-Code-1.0
Cohere's 30B MoE Coding-Modell mit 3B aktiven Parametern. Early Access auf HuggingFace veröffentlicht. Läuft lokal mit moderatem VRAM. 1.701 Downloads im letzten Monat.
MiniMax M3 Open Weights
MiniMax M3 wurde am 1. Juni 2026 veröffentlicht. Das Unternehmen hat angekündigt, dass technischer Report und Modellgewichte innerhalb von ~10 Tagen nach Launch veröffentlicht werden. Die Veröffentlichung der Open Weights steht in den nächsten Tagen bevor.
Gemma 4 QAT für mobile Geräte
Google hat Gemma 4 QAT (Quantization-Aware Training) Modelle veröffentlicht, die speziell für mobile Geräte und Laptops optimiert sind. Verfügbar in 2B, 4B, 12B und 26B Varianten. Reduziert Speicherbedarf bei gleichbleibender Genauigkeit.
KoHRM-Text-1.4B FullSFT Terminal ToolBench
LLM-OS-Models hat KoHRM-Text-1.4B mit FullSFT auf LFM25-Terminal-ToolBench trainiert. Koreanisch-Englisch HRM-Modell für Terminal/Tool-Nutzung, 1.4B Parameter.
Gemma 4 weitere Varianten
Weitere Gemma 4 Modelle werden erwartet, moeglicherweise ein Gegenstueck zu Qwen 27B (dichtes Modell).
Holo3.1 VLM Familie
Neue Vision-Language-Modelle fuer Computer-Use-Agenten: Holo3.1-0.8B, Holo3.1-4B, Holo3.1-9B.
MiniMax M3
MiniMax M3 wurde Ende Mai / Anfang Juni veroeffentlicht. Open-Weight Coding-Modell, konkurriert mit Qwen3-Coder-Next.
ChartNet
ChartNet ist ein neues KI-Modell, das Chart-Daten lesen und interpretieren kann. Es ermoeglicht kleineren Modellen, kommerzielle Rivalen bei Chart-basierten Aufgaben zu uebertreffen.
Microsoft MAI-Thinking-1 Details
Weitere Details zu Microsofts MAI-Modellfamilie von der Build 2026. MAI-Thinking-1 ist speziell fuer komplexe Reasoning-Aufgaben optimiert und koennte bald als kostenloser API-Tier verfuegbar sein.
Microsoft MAI-Familie
Microsoft hat auf der Build 2026 sieben neue MAI-Modelle angekündigt, darunter MAI-Thinking-1, MAI-Image-2.5 und MAI-Transcribe-1.5. Drei davon sind bereits kostenlos auf OpenRouter verfügbar.
NVIDIA Cosmos 3 & Nemotron 3 Ultra
NVIDIA hat auf der Computex Cosmos 3 (World Foundation Model) und Nemotron 3 Ultra angekuendigt. Details zu freien API-Tiers stehen noch aus.
OpenAI GPT-5.5 Short Context
OpenAI hat GPT-5.5 Short Context mit günstigeren Preisen ($12.50/M Tokens input) auf Azure veröffentlicht.
GPT-5.5 frei zugänglich
Spekulationen dass OpenAI GPT-5.5 für alle ChatGPT-Nutzer freigeben könnte.
Qwen 3.7 Open Weights
Die Community wartet auf die Open-Weight-Veröffentlichung von Qwen 3.7.
OpenAI Phi-5 (Gerücht)
Gerüchte über ein neues Open-Weight-Modell von OpenAI, das als 'Phi-5' bezeichnet wird. Wurde in r/LocalLLaMA diskutiert, aber keine offizielle Bestätigung.
DeepSeek Reasonix
DeepSeek Coding-Agent mit V4 Flash und optimiertem KV-Caching.
OpenAI Phi-5 Gerücht
Gerüchte über neues OpenAI-Open-Weight-Modell 'Phi-5' in r/LocalLLaMA.
SubQ 1M-Preview
Subquadratic hat mit SubQ 1M-Preview das erste kommerzielle nicht-Transformer-Modell vorgestellt. Mit einem nativen Kontextfenster von 12 Mio. Token und bis zu 52× schnellerer Attention bei großen Kontexten könnte es eine Architektur-Revolution einläuten. Derzeit nur als API-Preview verfügbar.
GPT-5.5 Instant
OpenAI hat GPT-5.5 Instant veröffentlicht, mit 50% weniger Halluzinationen im kostenlosen Tarif. Eine günstigere, schnellere Variante von GPT-5.5 für den freien Zugang.
Qwen 3.7 open-weight release
Qwen3.7 Max is on OpenRouter but community is waiting for open-weight release. Qwen team seen as less enthusiastic about full open-weight releases recently.
BitNet new model releases
New BitNet (1-bit) models released that can run on CPU without special quantization libraries.
Meta Avocado
Meta's next-generation LLM 'Avocado' reportedly delayed to May 2026 after internal tests showed it lagging behind competing models from Google, OpenAI, and others.
Qwen3.7 open-weight variants
Community speculation about upcoming open-weight releases of Qwen3.7 in smaller sizes (35B A3B and below), following the proprietary Qwen3.7-Max launch.
Qwen 3.7 open-weight variants
Community discussion about upcoming open-weight releases of Qwen 3.7 in smaller sizes following the proprietary Qwen3.7-Max launch. Reddit thread shows ongoing anticipation.