Vorschau-Umgebung - hier siehst du auch noch nicht freigegebenen Content.

Wissens-Changelog

Was über die Zeit ins System kam - neue Bausteine, Tutorials und Aktualisierungen, chronologisch.

Juli 2026

  • 31. JuliNeuworkshop

    Harness, Teil 1: Der LLM-Call

    Die Werkbank hat ihren ersten zusammenhängenden Kurs: die Harness-Serie, neun Kapitel, in denen du deinen eigenen Agenten-Harness baust. Vom LLM-Call über Message-History, System-Prompt, Tools & Loop, Guardrails, Memory, Kanäle & Trigger und Kontext-Kompaktierung bis zur Tool-Call-Optimierung, bei der ein kleines Modell den Werkzeuggriff übernimmt und das große denkt. Jedes Kapitel bringt kopierbare Bau-Prompts mit, gebaut wird gegen die echte API statt gegen eine Attrappe. Aus dem gemeinsamen Probelauf der ersten vier Teile sind die Erkenntnisse zurückgeflossen - darunter der Fall „Modell quittiert, ohne das Werkzeug angefasst zu haben", der jetzt Teil der Abnahme ist.

  • 31. JuliAktualisiertconcept

    Der LLM-Call

    Der LLM-Call bekommt zwei interaktive Flächen. Die Rätselwand im Jeopardy-Stil klopft ab, was von finish_reason, max_tokens, Stoppwörtern und Modellwahl hängengeblieben ist - vier Kategorien, vier Punktwerte, zu jeder Frage eine erklärende Auflösung, wahlweise allein, im Vollbild oder als Hot Seat zu zweit bis viert. Im Deep Dive zeigt der Tokenizer-Playground jetzt einen zweiten Modus: den BPE-Lauf vom Korpus zum Vokabular, Verschmelzung für Verschmelzung.

  • 31. JuliAktualisiertconcept

    Sidecars

    Sidecars: ein neuer Abschnitt darüber, was durch die Prozessgrenze zurückläuft. An einer echten Sitzung im Session-Viewer nachgerechnet - drei curl-Abrufe kippen 52 489 Zeichen in den Kontext, 43,5 % des ganzen Verlaufs, die teuerste Nachricht sind 25 400 Zeichen aus drei Fehlerseiten. Ein Sidecar gibt das Ergebnis zurück statt des Rohmaterials. Mit der ehrlichen Gegenprobe: Kontexteinsparung allein begründet noch kein Sidecar.

  • 30. JuliNeuconcept

    Tool-Calling im Betrieb

    Neuer Baustein in Block II: Tool-Calling im Betrieb. Der Werkzeugaufruf funktioniert im Prototyp und zerbricht in Produktion - nicht am Modell, sondern an sechs Übersetzungen dazwischen. Oben frei die Problematik samt Kettenrechnung, darunter sieben Kapitel für Pro-Mitglieder: Fehlerkatalog, erzwungene Syntax, Werkzeugkasten, Reparieren, Nachweise - und zum Schluss FunctionGemma, der 270-Millionen-Parameter-Spezialist, der neben dem großen Modell steht statt an seiner Stelle. Mit fünf neuen interaktiven Flächen - und oben auf der Seite dem Werkstattbuch zum Thema, 90 Seiten als PDF für Pro-Mitglieder.

  • 29. JuliNeuconcept

    Benchmarks

    Neuer Baustein: Benchmarks. Jede Woche „schlägt" ein neues Modell alle anderen. Benchmarks machen aus diesem Lärm Zahlen - nützlich fürs Grobsortieren, gefährlich, wenn man ihnen blind glaubt. Der Baustein geht die Namen durch, die dir überall begegnen, und zeigt, was sie messen und was nicht.

  • 29. JuliNeuconcept

    Hardware

    Neuer Baustein: Hardware. Warum reden beim Thema LLM alle über Grafikkarten? Weil Speicher die harte Grenze ist: VRAM entscheidet, welche Modelle du überhaupt wählen kannst, und was jede Antwort kostet. Lohnt sich auch, wenn du nie eine eigene GPU kaufst - es erklärt die Preise und die Auswahl.

  • 29. JuliNeuconcept

    Inferenz-Engines

    Neuer Baustein: Inferenz-Engines. Eine Modelldatei ist nur ein Sack voller Zahlen. Dass daraus eine API wird, die auf deinen Call antwortet, ist die Arbeit der Engine - des Plattenspielers, der die Platte abspielt. Sie erzeugt die Antwort Token für Token und hält das mit KV-Cache und Batching schnell.

  • 29. JuliNeuconcept

    Was in einem Modell-Download steckt

    Neuer Baustein: Was in einem Modell-Download steckt. „Lokal betreiben" heißt konkret: ein Ordner mit ein paar Gigabyte darin, und nichts, was von allein etwas tut. Der Baustein geht ihn Datei für Datei durch - und zeigt, warum ausgerechnet die kleinste davon, das Chat-Template, darüber entscheidet, ob dein Modell antwortet oder stottert.

  • 29. JuliNeuconcept

    Die Modell-Landschaft

    Neuer Baustein: Die Modell-Landschaft. „Das eine LLM" gibt es nicht - es gibt hunderte Modelle, in allen Größen, offen und geschlossen. Die erste Weiche ist nicht „welches Modell", sondern „wo läuft es": beim Anbieter oder auf deiner Hardware. Die gute Nachricht: dein Harness bleibt derselbe, nur die Nummer, die er wählt, ändert sich.

  • 29. JuliNeuconcept

    Sidecars

    Neuer Baustein: Sidecars. Was hängt eigentlich am anderen Ende eines Tools? Wer parst das PDF, wer transkribiert die Tonspur? In fast allen ernsthaften Aufbauten ein Sidecar: ein Dienst neben dem Agenten, der genau eine Sache kann und nach der Antwort nichts behält. Warum das ein eigener Container ist und keine Funktion im Agenten-Prozess.

  • 29. JuliNeuconcept

    Memory

    Neuer Baustein: Memory. Ein Agent erinnert sich nie - er schickt mit. Der Baustein zeigt, wie Informationen überhaupt in den Kontext kommen, was einmal pro Sitzung und was bei jeder Anfrage mitfährt, und ab wann dafür ein eigener Dienst neben dem Agenten steht. Es ist der erste Schritt aus dem Harness heraus.

  • 27. JuliAktualisiertconcept

    Tools & Loop

    Neue Recap-Bühne auf dem Tools-und-Loop-Baustein: Chat, Draht und Code im Vollbild nebeneinander. Die Bühne spielt eine komplette Tool-Runde durch - Modell wünscht einen Aufruf, Harness führt aus, Ergebnis geht zurück - und macht sichtbar, dass der Loop im Harness wohnt, nicht im Modell.

  • 27. JuliAktualisiertconcept

    System Prompt

    Neue Recap-Bühne auf dem System-Prompt-Baustein: Chat, Draht und Code im Vollbild nebeneinander. Zu sehen ist, wo der System-Prompt in der Anfrage sitzt, dass er bei jedem Zug mitreist - und wie derselbe Nutzer-Satz mit anderem System-Prompt eine andere Antwort bekommt.

  • 27. JuliAktualisiertconcept

    Message-History

    Neue Recap-Bühne auf dem Message-History-Baustein: Chat, Draht und Code im Vollbild nebeneinander. Die Bühne zeigt, wie aus einzelnen Aufrufen ein Gespräch wird - welche Nachrichten bei jedem Zug erneut über den Draht gehen und was das für Kontext und Kosten bedeutet.

  • 27. JuliAktualisiertconcept

    Der LLM-Call

    Der LLM-Call-Baustein hat jetzt eine Vollbild-Bühne: der Harness-Recap zeigt Chat, Draht und Code nebeneinander und spielt den ersten Aufruf Schritt für Schritt durch. Neu im Deep Dive außerdem der Tokenizer-Playground - drei Tokenizer laufen vollständig im Browser (unser Qwen3 als byte-level BPE, cl100k_base, GPT-2), und die drei Behauptungen der Lerneinheit lassen sich in Sekunden selbst nachprüfen: Deutsch kostet mehr Tokens als Englisch, jedes Modell zerlegt anders, und an „Strawberry" scheitert der Tokenizer, nicht das Modell.

  • 26. JuliAktualisiertconcept

    Guardrails

    Der Guardrails-Baustein behandelt Prompt Injection nicht mehr als Warnung, sondern als Lernstrecke: die Verteidigungsleiter von Stufe 0 bis 6 als Tabelle, jede Schicht mit dem Angriff, an dem sie zerbricht. Dazu die drei Befunde aus Lakeras Auswertung von 279 000 echten Angriffen (Schichtung wirkt, Domänen-Einschränkung ist die stärkste Einzelmaßnahme, Verteidigung im System-Prompt kostet Nutzbarkeit), die Einordnung als OWASP LLM01 - und der Kommentar-Agent dieser Seite als Beispiel aus dem eigenen Haus. Beendete Arena-Challenges bekommen dazu eine Auflösung: welche Schicht wie oft gegriffen hat, und wo die Sackgassen lagen.

  • 25. JuliAktualisierttutorial

    OpenRouter-Key besorgen und ersten Call machen

    Das Einstiegs-Tutorial zum ersten LLM-Call läuft jetzt über OpenRouter statt über einen direkten Anthropic-Account: ein Key, hunderte Modelle, kostenlose Varianten — ohne Firmenverifizierung. Neu mit Screenshots für Registrierung und Key-Erzeugung, curl- und SDK-Variante, einem Vergleich der Response-Felder zum Anthropic-Dialekt und dem Weg, den Key direkt im eigenen Konto zu hinterlegen.

  • 24. JuliAktualisiertconcept

    Der LLM-Call

    Wir haben das Einstiegthema für den LLM Call nochmals erweitert und ein neues Erklär-Video dazu erstellt