Der Pilot kommt nicht in Produktion
Eine Demo funktioniert, aber Qualität, Berechtigungen, Kosten oder Betrieb sind noch nicht gelöst.
01 / AI-/KI-ENTWICKLER & LLM-FREELANCER BERLIN
Ich entwickle AI-Funktionen für echte Fachprozesse: von Daten- und Evaluationspipelines über RAG bis zu kontrollierten Agenten mit Werkzeugzugriff. Qualität, Berechtigungen, Kosten und Betrieb werden vor dem produktiven Einsatz messbar gemacht.
DIE FRAGE IM PROJEKT
Mit einem klar abgegrenzten Anwendungsfall, repräsentativen Testdaten und einer Architektur, die Modell, Datenzugriff und Werkzeugrechte getrennt kontrolliert. Erst messbare Ergebnisse entscheiden über den Ausbau.
WANN ICH IHR TEAM UNTERSTÜTZE
Der erste Schritt ist keine Modellauswahl. Wir klären Aufgabe, Daten, zulässige Fehler und Erfolgskriterien. So wird früh sichtbar, ob RAG, ein Agent, klassische Automatisierung oder eine Kombination wirtschaftlich sinnvoll ist.
Eine Demo funktioniert, aber Qualität, Berechtigungen, Kosten oder Betrieb sind noch nicht gelöst.
Dokumente und Fachdaten sollen über RAG zuverlässig erschlossen werden – mit Quellen und klaren Zugriffsregeln.
Juristische, technische oder interne Daten dürfen nicht ungeprüft an externe Modellanbieter übertragen werden.
Ihre Entwickler kennen das Produkt; benötigt wird Erfahrung mit Retrieval, Agenten, Evals und lokalem Betrieb.
AI ENGINEERING / ENTSCHEIDUNGSSYSTEM
Ein belastbares AI-System entsteht nicht durch die Wahl eines bekannten Modells. Datenqualität, Retrieval, Modellverhalten, Quantisierung und Betrieb werden getrennt entworfen und mit repräsentativen Aufgaben verglichen. So fließt Budget in die Komponente, die nachweislich verbessert werden muss.
Fachliche Erfolgskriterien, schwierige Fälle und zulässige Fehler werden zuerst festgelegt. Eine einfache Baseline zeigt, ob RAG, ein Agent, Fine-Tuning oder klassische Software überhaupt einen messbaren Vorteil bringt.
Ich entwickle Pipelines für Erfassung, Bereinigung, Deduplizierung, Normalisierung, Annotation, Versionierung und Qualitätssicherung. Train-, Validierungs- und Testdaten bleiben getrennt, damit Overfitting nicht als Fortschritt erscheint.
Dokumentaufbereitung, Chunking, Metadaten, Berechtigungsfilter, Embedding-Modell, Vektorsuche und Reranking werden separat evaluiert. Damit ist erkennbar, ob Retrieval oder Antwortgenerierung die tatsächliche Fehlerquelle ist.
Frontier-Modelle, lokale Modelle und spezialisierte kleine Modelle werden mit denselben Aufgaben verglichen. Qwen3.6-27B und Gemma 4 31B sind mögliche lokale Kandidaten, aber Latenz, Qualität, Datenschutz und Betrieb entscheiden, nicht ein öffentlicher Benchmark.
FP16, BF16 oder quantisierte Varianten können Speicherbedarf, Kontext, Parallelität und Antwortqualität deutlich verändern. Ich messe diese Effekte auf der vorhandenen Hardware, statt Quantisierung pauschal als kostenlosen Gewinn zu behandeln.
Schlechte oder widersprüchliche Trainingsdaten werden durch Fine-Tuning nicht gut. Erst wenn Prompting, RAG und Werkzeuglogik sauber bewertet sind und ein stabiles Verhaltensproblem bleibt, werden SFT oder Adapter-Tuning mit unabhängigen Regressionstests geprüft.
Qualität, Datenschutz, Latenz, Durchsatz und Betriebskosten werden gemeinsam gemessen. Die Architektur bleibt austauschbar, wenn bessere Modelle verfügbar werden.
AUSGEWÄHLTE PROJEKTE / 2
Reale Arbeit, nachvollziehbar beschrieben. Vertrauliche Oberflächen und Daten bleiben konsequent anonymisiert.
SCREEN / 01Anonymisierte UI-Rekonstruktion · keine Mandanten- oder Falldaten
Für ein Unternehmen aus der Rechtsbranche entstand eine Plattform, die umfangreiche juristische Quellen erschließt, Sachverhalte strukturiert und Arbeitsentwürfe vorbereitet. Mehrere Rechtsanwälte stellten reale Testfälle bereit und bewerteten die fachliche Qualität.
SCREEN / 02Anonymisierte Agentenkonsole · Zieldaten vollständig synthetisch
Ein autonom arbeitendes System plant Tests, nutzt isolierte Sicherheitswerkzeuge, bewertet Belege und dokumentiert nachvollziehbare Schwachstellen. Die Architektur funktioniert mit unterschiedlichen Modellklassen.
AI-GESTÜTZTE ENTWICKLUNG
AI kann Analyse, Implementierung, Tests und Dokumentation beschleunigen. Welche Modelle eingesetzt werden, richtet sich nach Aufgabe, Datenklasse und gewünschter Kontrolle.
Bei unkritischen Daten beschleunigen leistungsfähige Modelle Recherche, Implementierung, Tests und Dokumentation. Ergebnisse werden wie jeder andere Beitrag geprüft.
Bei vertraulichem Code, juristischen Daten oder internen Dokumenten können Modelle lokal oder in Ihrer kontrollierten Infrastruktur laufen.
KUNDENSTIMMEN / AI-ENTWICKLUNG
“Für Damian ist das Kundenproblem eine Herausforderung, das Ergebnis ist immer herausragend. Er arbeitet sich in jede Problemstellung so tief ein, bis er eine Lösung gefunden hat. Niederlage ist keine Option für Damian.
“Damian ist ein echter Glücksfall. Klare, offene Kommunikation und die absolut transparente Arbeitsweise machen die Zusammenarbeit zu einem Erfolgserlebnis. Unsere Anforderungen wurden kompetent und flexibel umgesetzt.
HÄUFIGE FRAGEN / AI-/KI-ENTWICKLER & LLM-FREELANCER BERLIN
Klare Antworten zu Einstieg, Zusammenarbeit, Datenschutz und Budget, bevor Sie Zeit in einen langen Vertriebsprozess investieren.
Offene Frage direkt stellen ↗Ja. Ich kann eine AI-Komponente eigenständig verantworten, Architektur und Qualitätsprüfung übernehmen oder Ihr Team bei der Umsetzung ergänzen. Entscheidungen und Schnittstellen werden so dokumentiert, dass das Wissen im Unternehmen bleibt.
Nein. Je nach Schutzbedarf können lokale Modelle, selbst betriebene Inferenz oder klar getrennte hybride Abläufe eingesetzt werden. Externe Modelle werden nur dort genutzt, wo Datenklasse und vereinbarte Regeln es erlauben.
Vor der Umsetzung werden repräsentative Aufgaben und Erfolgskriterien definiert. Danach messen wir unter anderem Quellenbezug, Aufgabenerfolg, Fehlerraten, Kosten und Regelverstöße mit wiederholbaren Tests.
Ja, wenn der erste Anwendungsfall eng gewählt wird. Ein fokussierter Pilot beantwortet die riskantesten Fragen zuerst und verhindert, dass Budget in eine technisch beeindruckende, aber fachlich nutzlose Demo fließt.
Frontier-Modelle beschleunigen Analyse, Implementierung, Tests und Dokumentation. Diese Geschwindigkeit wird mit manuellen Reviews und automatisierten Tests kombiniert. Bei sensiblen Aufgaben stehen lokale Modelle zur Verfügung.
Das hängt stärker von Datenlage, Integrationen und Qualitätsanforderungen ab als vom gewählten Modell. Nach einer kurzen Einordnung erhalten Sie einen sinnvollen ersten Umfang mit Annahmen und Budgetrahmen. Ein enger Machbarkeitscheck oder Pilot begrenzt das Risiko vor einer größeren Umsetzung.
Für kompakte und mittelgroße Modelle steht eine Workstation mit 256 GB RAM und zwei RTX 4090 bereit. Zwei DGX-Spark-Systeme erweitern den lokalen Speicher für größere Modelle und Kontexte. Kandidaten wie Qwen3.6-27B und Gemma 4 31B werden in geeigneten Quantisierungsstufen mit Ihren Aufgaben verglichen. Qualität, Latenz, Durchsatz und Datenschutz entscheiden, nicht eine Modellrangliste.
Wenn ein klar abgegrenztes, wiederkehrendes Verhaltensproblem mit Prompting, RAG oder Werkzeuglogik nicht zuverlässig lösbar ist und ausreichend hochwertige Trainingsdaten vorliegen. Ohne saubere Daten, getrenntes Testset und Baseline kann Fine-Tuning Fehler festschreiben statt Qualität zu erhöhen.
Ein klar abgegrenzter Pilot lässt sich häufig in wenigen Wochen bewerten. Entscheidend sind verfügbare Testdaten, Integrationen und die Frage, welche Qualitätsgrenze erreicht werden muss. Vor dem Start werden Ergebnis, Abbruchkriterien und nächster Entscheidungspunkt festgelegt.
DREI DISZIPLINEN, EIN ANSPRECHPARTNER
Anspruchsvolle Projekte profitieren davon, wenn moderne AI, skalierbare Produktentwicklung und offensive IT-Sicherheit gemeinsam gedacht werden.