01 / AI-/KI-ENTWICKLER & LLM-FREELANCER BERLIN

AI- und LLM-Produkte, die im Arbeitsalltag zuverlässig funktionieren.

Ich entwickle AI-Funktionen für echte Fachprozesse: von Daten- und Evaluationspipelines über RAG bis zu kontrollierten Agenten mit Werkzeugzugriff. Qualität, Berechtigungen, Kosten und Betrieb werden vor dem produktiven Einsatz messbar gemacht.

DIE FRAGE IM PROJEKT

„Wie bringen wir AI produktiv in unsere Abläufe, ohne Qualität, Kosten oder vertrauliche Daten aus der Hand zu geben?“

MEINE ANTWORT

Mit einem klar abgegrenzten Anwendungsfall, repräsentativen Testdaten und einer Architektur, die Modell, Datenzugriff und Werkzeugrechte getrennt kontrolliert. Erst messbare Ergebnisse entscheiden über den Ausbau.

WANN ICH IHR TEAM UNTERSTÜTZE

Wenn ein AI-Pilot messbaren Nutzen liefern und in Produktion bestehen muss.

Der erste Schritt ist keine Modellauswahl. Wir klären Aufgabe, Daten, zulässige Fehler und Erfolgskriterien. So wird früh sichtbar, ob RAG, ein Agent, klassische Automatisierung oder eine Kombination wirtschaftlich sinnvoll ist.

01

Der Pilot kommt nicht in Produktion

Eine Demo funktioniert, aber Qualität, Berechtigungen, Kosten oder Betrieb sind noch nicht gelöst.

02

Internes Wissen bleibt schwer nutzbar

Dokumente und Fachdaten sollen über RAG zuverlässig erschlossen werden – mit Quellen und klaren Zugriffsregeln.

03

Sensible Daten begrenzen die Modellwahl

Juristische, technische oder interne Daten dürfen nicht ungeprüft an externe Modellanbieter übertragen werden.

04

Dem Team fehlt AI-Produkterfahrung

Ihre Entwickler kennen das Produkt; benötigt wird Erfahrung mit Retrieval, Agenten, Evals und lokalem Betrieb.

AI ENGINEERING / ENTSCHEIDUNGSSYSTEM

Von Trainingsdaten bis Inferenz: Jede Schicht wird geprüft.

Ein belastbares AI-System entsteht nicht durch die Wahl eines bekannten Modells. Datenqualität, Retrieval, Modellverhalten, Quantisierung und Betrieb werden getrennt entworfen und mit repräsentativen Aufgaben verglichen. So fließt Budget in die Komponente, die nachweislich verbessert werden muss.

  1. 01

    Ziel, Testset und Baseline vor der Architektur

    Fachliche Erfolgskriterien, schwierige Fälle und zulässige Fehler werden zuerst festgelegt. Eine einfache Baseline zeigt, ob RAG, ein Agent, Fine-Tuning oder klassische Software überhaupt einen messbaren Vorteil bringt.

  2. 02

    Trainingsdaten-Pipelines statt ungeprüfter Datensammlungen

    Ich entwickle Pipelines für Erfassung, Bereinigung, Deduplizierung, Normalisierung, Annotation, Versionierung und Qualitätssicherung. Train-, Validierungs- und Testdaten bleiben getrennt, damit Overfitting nicht als Fortschritt erscheint.

  3. 03

    RAG, Embedding-Modelle und Vektordatenbanken als Gesamtsystem

    Dokumentaufbereitung, Chunking, Metadaten, Berechtigungsfilter, Embedding-Modell, Vektorsuche und Reranking werden separat evaluiert. Damit ist erkennbar, ob Retrieval oder Antwortgenerierung die tatsächliche Fehlerquelle ist.

  4. 04

    Das kleinste geeignete Modell gewinnt

    Frontier-Modelle, lokale Modelle und spezialisierte kleine Modelle werden mit denselben Aufgaben verglichen. Qwen3.6-27B und Gemma 4 31B sind mögliche lokale Kandidaten, aber Latenz, Qualität, Datenschutz und Betrieb entscheiden, nicht ein öffentlicher Benchmark.

  5. 05

    Quantisierung wird gegen Qualität und Durchsatz getestet

    FP16, BF16 oder quantisierte Varianten können Speicherbedarf, Kontext, Parallelität und Antwortqualität deutlich verändern. Ich messe diese Effekte auf der vorhandenen Hardware, statt Quantisierung pauschal als kostenlosen Gewinn zu behandeln.

  6. 06

    Fine-Tuning erst, wenn Daten und Fehlerbild es rechtfertigen

    Schlechte oder widersprüchliche Trainingsdaten werden durch Fine-Tuning nicht gut. Erst wenn Prompting, RAG und Werkzeuglogik sauber bewertet sind und ein stabiles Verhaltensproblem bleibt, werden SFT oder Adapter-Tuning mit unabhängigen Regressionstests geprüft.

ENTSCHEIDUNGSREGEL Keine Modellwahl ohne aufgabenspezifischen Test. Kein Fine-Tuning ohne belastbare Daten.

Qualität, Datenschutz, Latenz, Durchsatz und Betriebskosten werden gemeinsam gemessen. Die Architektur bleibt austauschbar, wenn bessere Modelle verfügbar werden.

AUSGEWÄHLTE PROJEKTE / 2

Ausgewählte Projekte
im Detail.

Reale Arbeit, nachvollziehbar beschrieben. Vertrauliche Oberflächen und Daten bleiben konsequent anonymisiert.

SCREEN / 01Anonymisierte UI-Rekonstruktion · keine Mandanten- oder Falldaten

AI für die Rechtsbranche · VertraulichANONYMISIERT

Legal Intelligence Platform

Juristische Recherche und Vorarbeit mit prüfbaren Quellen beschleunigen.

Für ein Unternehmen aus der Rechtsbranche entstand eine Plattform, die umfangreiche juristische Quellen erschließt, Sachverhalte strukturiert und Arbeitsentwürfe vorbereitet. Mehrere Rechtsanwälte stellten reale Testfälle bereit und bewerteten die fachliche Qualität.

HERAUSFORDERUNG
Eine plausible Formulierung reicht in juristischen Abläufen nicht aus. Quelle, Aktualität, Zuständigkeit und Argumentationsweg müssen für den bearbeitenden Anwalt nachvollziehbar bleiben.
LÖSUNG
Fachspezifische RAG-Pipelines verbinden angepasste Embedding- und Reranking-Modelle mit Quellenbindung, Rollenrechten, strukturierten Qualitätsprüfungen und fachlicher Freigabe.
ERGEBNIS
Recherche und Vorarbeit werden in einem gemeinsamen Arbeitsablauf vorbereitet; die rechtliche Bewertung und Freigabe bleiben nachvollziehbar beim Fachanwalt.
  • Fachspezifisches RAG & Reranking
  • Antworten mit konkretem Quellenbezug
  • Referenztests aus realen Anwaltsfällen
  • Mandanten- und Rollenmodell
  • Private Modelloptionen
LaravelLLMsEmbeddingsVektorsucheQualitätstests
VERTRAULICH / ANONYMISIERT
CASE-STUDYAutonomer Pentest-Agent
PROJEKTANSICHT
MODELLElokal möglich
WERKZEUGEisoliert
BELEGEnachvollziehbar
GEPRÜFTER STATUS
Lokale Modelle & eigene InfrastrukturAKTIV
Isolierte WerkzeugausführungGEPRÜFT
Nachvollziehbare BerichteAKTIV
Modellunabhängige ArchitekturGEPRÜFT

SCREEN / 02Anonymisierte Agentenkonsole · Zieldaten vollständig synthetisch

AI-gestützte IT-SicherheitANONYMISIERT

Autonomer Pentest-Agent

Ein Pentest-Agent, der nicht an einen Modellanbieter gebunden ist.

Ein autonom arbeitendes System plant Tests, nutzt isolierte Sicherheitswerkzeuge, bewertet Belege und dokumentiert nachvollziehbare Schwachstellen. Die Architektur funktioniert mit unterschiedlichen Modellklassen.

HERAUSFORDERUNG
Informationen über Kundensysteme und Schwachstellen dürfen nicht bei externen Modellanbietern landen. Gleichzeitig müssen Agenten kontrollierbar, wiederholbar und beweisorientiert arbeiten.
LÖSUNG
Modellunabhängige Orchestrierung, lokale Inferenz, isolierte Werkzeugausführung, klare Aktionsbudgets und Qualitätsprüfungen anhand realer, autorisierter Testfälle.
ERGEBNIS
Starke Ergebnisse in realitätsnahen Fällen – mit lokalen Modellen, begrenzten Werkzeugzugriffen und klarer menschlicher Kontrolle.
  • Lokale Modelle & eigene Infrastruktur
  • Isolierte Werkzeugausführung
  • Nachvollziehbare Berichte
  • Modellunabhängige Architektur
  • Menschliche Freigaben
Lokale LLMsAI-AgentenPythonDockerBurp Suite

AI-GESTÜTZTE ENTWICKLUNG

Schneller umsetzen.
Datenrisiken bewusst steuern.

AI kann Analyse, Implementierung, Tests und Dokumentation beschleunigen. Welche Modelle eingesetzt werden, richtet sich nach Aufgabe, Datenklasse und gewünschter Kontrolle.

01SCHNELL

Frontier-Modelle für geeignete Aufgaben

Bei unkritischen Daten beschleunigen leistungsfähige Modelle Recherche, Implementierung, Tests und Dokumentation. Ergebnisse werden wie jeder andere Beitrag geprüft.

  • Mehr Iterationen im gleichen Zeitrahmen
  • Schnellere Prototypen und Migrationen
  • Manuelle Reviews und automatisierte Tests
02VERTRAULICH

Lokale Modelle für sensible Arbeit

Bei vertraulichem Code, juristischen Daten oder internen Dokumenten können Modelle lokal oder in Ihrer kontrollierten Infrastruktur laufen.

  • Keine sensiblen Daten an externe Modellanbieter
  • Modellunabhängige Architektur
  • Betrieb passend zu Ihren Datenschutzanforderungen

KUNDENSTIMMEN / AI-ENTWICKLUNG

Was Kunden an der
Zusammenarbeit schätzen.

Für Damian ist das Kundenproblem eine Herausforderung, das Ergebnis ist immer herausragend. Er arbeitet sich in jede Problemstellung so tief ein, bis er eine Lösung gefunden hat. Niederlage ist keine Option für Damian.

Konstantin Kutzermeetyoo conferencing GmbH

Damian ist ein echter Glücksfall. Klare, offene Kommunikation und die absolut transparente Arbeitsweise machen die Zusammenarbeit zu einem Erfolgserlebnis. Unsere Anforderungen wurden kompetent und flexibel umgesetzt.

Wenke KunzeE. Wagemann High Performance Consulting GmbH

HÄUFIGE FRAGEN / AI-/KI-ENTWICKLER & LLM-FREELANCER BERLIN

Was Teamleads vor dem Projekt wissen möchten.

Klare Antworten zu Einstieg, Zusammenarbeit, Datenschutz und Budget, bevor Sie Zeit in einen langen Vertriebsprozess investieren.

Offene Frage direkt stellen
Arbeiten Sie auch mit bestehenden Entwicklungs- und Fachteams?+

Ja. Ich kann eine AI-Komponente eigenständig verantworten, Architektur und Qualitätsprüfung übernehmen oder Ihr Team bei der Umsetzung ergänzen. Entscheidungen und Schnittstellen werden so dokumentiert, dass das Wissen im Unternehmen bleibt.

Müssen unsere Daten an OpenAI, Anthropic oder andere externe Anbieter gehen?+

Nein. Je nach Schutzbedarf können lokale Modelle, selbst betriebene Inferenz oder klar getrennte hybride Abläufe eingesetzt werden. Externe Modelle werden nur dort genutzt, wo Datenklasse und vereinbarte Regeln es erlauben.

Wie prüfen Sie, ob ein RAG-System oder Agent wirklich funktioniert?+

Vor der Umsetzung werden repräsentative Aufgaben und Erfolgskriterien definiert. Danach messen wir unter anderem Quellenbezug, Aufgabenerfolg, Fehlerraten, Kosten und Regelverstöße mit wiederholbaren Tests.

Kann ein kleines Budget für einen sinnvollen Start reichen?+

Ja, wenn der erste Anwendungsfall eng gewählt wird. Ein fokussierter Pilot beantwortet die riskantesten Fragen zuerst und verhindert, dass Budget in eine technisch beeindruckende, aber fachlich nutzlose Demo fließt.

Warum kann die Entwicklung trotz langjähriger Erfahrung wirtschaftlich sein?+

Frontier-Modelle beschleunigen Analyse, Implementierung, Tests und Dokumentation. Diese Geschwindigkeit wird mit manuellen Reviews und automatisierten Tests kombiniert. Bei sensiblen Aufgaben stehen lokale Modelle zur Verfügung.

Was kostet ein AI- oder LLM-Projekt?+

Das hängt stärker von Datenlage, Integrationen und Qualitätsanforderungen ab als vom gewählten Modell. Nach einer kurzen Einordnung erhalten Sie einen sinnvollen ersten Umfang mit Annahmen und Budgetrahmen. Ein enger Machbarkeitscheck oder Pilot begrenzt das Risiko vor einer größeren Umsetzung.

Welche lokalen Modelle und Systeme stehen zur Verfügung?+

Für kompakte und mittelgroße Modelle steht eine Workstation mit 256 GB RAM und zwei RTX 4090 bereit. Zwei DGX-Spark-Systeme erweitern den lokalen Speicher für größere Modelle und Kontexte. Kandidaten wie Qwen3.6-27B und Gemma 4 31B werden in geeigneten Quantisierungsstufen mit Ihren Aufgaben verglichen. Qualität, Latenz, Durchsatz und Datenschutz entscheiden, nicht eine Modellrangliste.

Wann ist Fine-Tuning sinnvoll?+

Wenn ein klar abgegrenztes, wiederkehrendes Verhaltensproblem mit Prompting, RAG oder Werkzeuglogik nicht zuverlässig lösbar ist und ausreichend hochwertige Trainingsdaten vorliegen. Ohne saubere Daten, getrenntes Testset und Baseline kann Fine-Tuning Fehler festschreiben statt Qualität zu erhöhen.

Wie lange dauert ein erster belastbarer Pilot?+

Ein klar abgegrenzter Pilot lässt sich häufig in wenigen Wochen bewerten. Entscheidend sind verfügbare Testdaten, Integrationen und die Frage, welche Qualitätsgrenze erreicht werden muss. Vor dem Start werden Ergebnis, Abbruchkriterien und nächster Entscheidungspunkt festgelegt.

DREI DISZIPLINEN, EIN ANSPRECHPARTNER

Ihr Projekt braucht mehr als
nur eine Disziplin?

Anspruchsvolle Projekte profitieren davon, wenn moderne AI, skalierbare Produktentwicklung und offensive IT-Sicherheit gemeinsam gedacht werden.