02 / was wir machen
KI-Entwicklung, die als Software ausgeliefert wird und nicht als Demo.
Retrieval, Agents und Modell-Integration, gebaut mit denselben Tests, Schnittstellen und der Fehlerbehandlung wie der Rest deines Produkts.
was drin ist
Ein Modell ist eine Komponente, kein Produkt. Wir testen es auch so.
- RAG & Retrieval
- Agents & Automation
- LLM-Integration
- Evaluation
Was KI-Entwicklung hier bedeutet
Ein KI-Feature ist gewöhnliche Software mit einer probabilistischen Komponente in der Mitte. Es braucht ein Schema, Fehlerbehandlung, Retries und einen Weg festzustellen, ob es letzten Dienstag schlechter geworden ist. Am Letzten scheitern die meisten LLM-Projekte, deshalb bauen wir die Evaluation, bevor wir das Feature bauen.
Aeternum behandelt ein Modell wie einen Zahlungsanbieter: eine Abhängigkeit mit Vertrag, mit einem Fehlerfall und mit einer Testsuite davor.
Was wir bauen
- Retrieval (RAG). Dokumenten-Ingestion, Chunking, Embeddings und eine Retrieval-Schicht, in die du hineinschauen kannst. Eine falsche Antwort lässt sich auf die Textstelle zurückführen, die sie verursacht hat.
- Agents und Automation. Tool-Calling-Workflows mit klaren Grenzen: was das Modell allein tun darf, was einen Menschen braucht, und was passiert, wenn ein Tool-Aufruf scheitert.
- LLM-Integration. Modellaufrufe hinter einer einzigen Schnittstelle, mit Prompt, Ausgabeschema und Retry-Regeln in der Versionskontrolle neben allem anderen.
- Evaluation. Ein bewertetes Testset, das in der CI läuft. Qualität wird damit zu einer Zahl, die du beobachten kannst, statt zu einem Eindruck.
Warum die Evaluation zuerst kommt
Ein Modell-Upgrade verbessert neun deiner Prompts und macht den zehnten still kaputt. Ohne bewertetes Testset gibt es keinen Weg herauszufinden, welcher es war, und keine Grundlage, mit einem Kunden darüber zu reden.
Wir sammeln das Set aus echten Eingaben, bevor der erste Prompt geschrieben wird. Es ist der Unterschied zwischen einem Feature, das du ändern kannst, und einem, das niemand mehr anfassen will.
Wovon wir dir abraten
Chat-Oberflächen, die auf Produkte geschraubt werden, die keine brauchen. Ist die eigentliche Aufgabe ein Formular mit sechs Feldern, dann ist ein Formular mit sechs Feldern für die Nutzerinnen und Nutzer schneller und für dich günstiger. Wir bauen lieber die kleine Sache, die funktioniert.
wie ein build abläuft
Wie ein Build abläuft
Die Aufgabe finden, nicht das Modell
Wir starten bei der Arbeit, die heute jemand von Hand macht, und dabei, wie lange sie dauert. Hat diese Arbeit kein messbares Resultat, kann ein LLM sie nicht verbessern, und wir sagen es dir, bevor du etwas ausgibst.
Zuerst das Evaluationsset
Ein fester Satz echter Eingaben mit bewerteten Sollausgaben, geschrieben vor dem ersten Prompt. Jede Prompt- und Modelländerung wird ab da dagegen gemessen.
Das Feature um den Aufruf herum bauen
Typisierte Schnittstellen, Retries, Timeouts, Fallbacks und ein protokollierter Trace pro Anfrage. Der Modellaufruf ist eine Komponente inmitten ganz normaler Software.
Mit der Evaluation in der CI ausliefern
Das Testset läuft bei jedem Pull Request. Eine Regression lässt einen Build scheitern, statt drei Wochen später in einer Kundendemo aufzutauchen.
fragen
Fragen zu AI Engineering.
Was ist RAG, in einem Satz?
Mit welchen Modellen arbeitet ihr?
Wie verhindert ihr, dass das Modell Dinge erfindet?
Wo liegen die Daten des Kunden?
beiträge dazu
Beiträge dazu
- Die KI-Verordnung wurde verschoben. Drei Teile davon nicht.
- Warum ein eigenes Modell in der Schweiz Sinn ergeben kann
Erzähl uns, was du bauen möchtest.
Schick uns das Briefing. Scope und Rahmen bekommst du innerhalb von zwei Arbeitstagen.