Fine-Tuning vs. Prompting für AI Agents: Wann Sie was einsetzen

Fine-Tuning versus Prompting: Live-Kontext fließt in einen AI-Kern, Trainingsbeispiele formen einen anderen

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

Fine-Tuning und Prompting lösen im Kern dasselbe Problem: ein AI-Modell so zu steuern, dass es sich verhält, wie Ihr Unternehmen es braucht. Sie tun es über zwei sehr unterschiedliche Mechanismen. Prompting (einschließlich RAG und Tool-Nutzung) steuert das Verhalten in dem Moment, in dem das Modell läuft, über Anweisungen, Beispiele und abgerufenen Kontext, und es lässt sich schnell ändern und schnell ausliefern. Fine-Tuning verankert Verhalten durch zusätzliches Training in den Gewichten des Modells selbst. Es ist langsamer zu ändern, kann aber eine bestimmte Fähigkeit oder ein Format zuverlässiger festschreiben, als ein Prompt es vermag. Für die meisten AI Agents ist Prompting der richtige Standard, und Fine-Tuning ist ein schmales Werkzeug für eine bestimmte Art von Lücke, die Prompting tatsächlich nicht schließen kann.

Zuerst: Was jedes Verfahren tatsächlich leistet

Prompting umfasst hier im weiten Sinn alles, was Sie ändern können, ohne das Modell neu zu trainieren: den System Prompt samt Regeln, Few-Shot-Beispiele, Retrieval-Augmented Generation, die Ihre Dokumente einbindet, und Tool-Aufrufe, mit denen der Agent Live-Daten prüft. Prompt Engineering behandelt das Handwerk, eine solche Anweisung gut zu formulieren, und Retrieval-Augmented Generation erklärt, wie sich ein Agent auf Ihre tatsächlichen Daten stützt, statt zu raten. Beides läuft zur Inferenzzeit, bei jedem Aufruf, auf einem universellen Basismodell. Das Engineering-Team von Anthropic beschreibt die moderne Form dieser Praxis als Context Engineering, die natürliche Weiterentwicklung des Prompt Engineering für Agents, die echte mehrstufige Arbeit leisten können, und zwar gerade deshalb, weil dafür nichts neu trainiert werden muss.

Fine-Tuning ist von anderer Art. Ein vortrainiertes Modell wird mit Ihren eigenen Beispielen weitertrainiert, und seine Gewichte werden so angepasst, dass ein Verhalten näher an einen Automatismus rückt, statt dass ein Prompt es bei jedem einzelnen Aufruf einfordern muss. Das macht es für eine bestimmte Art von Problem sehr wirksam und für andere weitgehend irrelevant. Genau deshalb kommt es darauf an, wonach Sie greifen.

Der Standard: Erst Prompt, RAG und Tools

Die Leitlinien von OpenAI zum Fine-Tuning sind bei der Reihenfolge eindeutig: Richten Sie zuerst Evaluierungen ein und investieren Sie erst in Fine-Tuning, wenn Sie messen können, ob es tatsächlich hilft. Das ist keine Absicherung, das ist die ganze Strategie. Ohne Evals können Sie nicht erkennen, ob ein feingetuntes Modell wirklich besser ist als ein gut geschriebener Prompt. Sie raten dann nur mit mehr Aufwand.

Prompt, RAG und Tools zuerst: austauschbare Kontext-Kartuschen speisen einen AI-Modellkern

Der praktische Grund, warum bei Agents Prompting zuerst kommt: Das meiste, was ein Agent richtig machen muss, ändert sich zu oft, um es in Gewichte zu gießen. Geschäftsregeln werden aktualisiert. Richtlinien ändern sich. Ein Produktkatalog verschiebt sich wöchentlich. RAG für AI Agents macht genau diesen Punkt: Retrieval liest im Moment der Frage aus der Quelle, sodass sich das nächste Update schon bei der nächsten Anfrage niederschlägt. Ein feingetuntes Modell, das die Richtlinie des letzten Quartals auswendig gelernt hat, ist an dem Tag veraltet, an dem sich die Richtlinie ändert, und ein erneutes Training ist keine Lösung für denselben Tag, wie es das Bearbeiten eines Dokuments oder eines Prompts ist. Der eigenständige Fall dieses Musters, ein Modell, das einmal abruft und antwortet, wird im RAG-Assistant-Muster behandelt. Ein Agent braucht typischerweise dieselbe Verankerung und zusätzlich die Fähigkeit, auf das Gefundene zu reagieren.

Wo sich Fine-Tuning wirklich lohnt

Fine-Tuning ist nicht überholt. Es zielt nur auf ein engeres Ziel, als die meisten Teams annehmen, wenn sie zum ersten Mal danach greifen. Die Dokumentation von OpenAI nennt die Fälle, in denen es verlässlich hilft: Klassifikationsaufgaben, nuancierte Übersetzungsarbeit, die Erzeugung von Inhalten in einem sehr bestimmten Format und die Korrektur von Fehlern bei der Befolgung von Anweisungen, die ein besserer Prompt nicht behoben hat. Beachten Sie, was auf dieser Liste fehlt: Allgemeinwissen und sich häufig ändernde Fakten, also genau das Terrain, das Prompting und RAG besser abdecken.

Einsatzfeld von Fine-Tuning: ein AI-Kern erzeugt mit einer Präzisionsform konsistente Klassifikationsergebnisse

Eine nützliche Trennlinie: Fine-Tuning ist gut darin, einem Modell beizubringen, wie es antwortet (Format, Tonalität, ein enges Klassifikationsverhalten, das zuverlässige Befolgen eines ungewöhnlichen Anweisungsmusters). Prompting und Retrieval sind besser darin, einem Modell beizubringen, womit es antwortet (aktuelle Fakten, Ihre konkreten Richtlinien, die Account-Historie dieses Kunden). Ein Agent braucht fast immer mehr vom Zweiten als vom Ersten, weil seine Aufgabe überwiegend darin besteht, auf Basis aktueller Informationen korrekt zu handeln, und nicht darin, stilistisch eigenständigen Text zu erzeugen.

Innerhalb eines größeren Agents ist der häufigste legitime Einsatz von Fine-Tuning gar nicht der zentrale Reasoning-Schritt. Es ist eine enge Teilaufgabe mit hohem Volumen, die als ein Baustein einer größeren Schleife läuft und nicht als das gesamte Gehirn des Agents. Der AI Support Triage Agent, der eingehende Tickets in die richtige Warteschlange einsortiert, ist genau die Art konsistenter, repetitiver Klassifikation mit hohem Volumen, bei der ein kleines feingetuntes Modell ein großes Allzweckmodell übertreffen kann, das bei jedem Aufruf für dieselbe enge Aufgabe geprompt wird. Der AI Document Processing Agent, der strukturierte Felder aus unordentlichen, uneinheitlich formatierten Dokumenten extrahiert, ist ein weiteres Beispiel. Beides sind eher Format- und Musterprobleme als Wissensprobleme, und genau das ist die Stärke von Fine-Tuning.

Ein Entscheidungsrahmen

Frage Spricht für Prompting/RAG/Tools Spricht für Fine-Tuning
Ändert sich das zugrunde liegende Wissen wöchentlich oder monatlich? Ja, spricht für Retrieval Selten, nur wenn wirklich stabil
Ist die Lücke ein fehlender Fakt oder ein falsches Format, Ton oder Verhalten? Fehlender Fakt Falsches Format oder Verhalten
Müssen Sie belegen oder erklären, woher eine Antwort stammt? Ja, Retrieval ist nachvollziehbar Gewichte sind nicht auf dieselbe Weise einsehbar
Ist dies eine enge, repetitive Teilaufgabe mit hohem Volumen? Nicht unbedingt Oft die beste Wahl
Haben Sie bereits einen gut geschriebenen Prompt und gute Beispiele ausprobiert? Versuchen Sie dies in jedem Fall zuerst Erst, nachdem dies wirklich gescheitert ist
Haben Sie die Evals, um zu messen, ob es geholfen hat? Bauen Sie diese in beiden Fällen auf Vor dem Start erforderlich

Die meisten Zeilen zeigen für die meisten Agents in dieselbe Richtung: Beginnen Sie mit Prompting, ergänzen Sie Retrieval für alles, was aktuelles oder proprietäres Wissen braucht, und heben Sie sich Fine-Tuning für die konkreten Zeilen auf, in denen es tatsächlich die bessere Wahl ist, nicht als Standard-Upgrade-Pfad.

Entscheidungspfad zur Anpassung eines AI Agents: von der Evaluierung über Prompting und Retrieval bis zum Fine-Tuning

Die Kostenseite der Entscheidung

Fine-Tuning ist nicht nur eine technische Wahl, sondern eine Infrastrukturverpflichtung: eine Trainingspipeline, ein gelabelter Datensatz, der mit Ihrem Geschäft mitwachsen muss, Evaluierung, um zu bestätigen, dass die feingetunte Version tatsächlich besser ist, und ein Re-Training-Rhythmus, wenn sich die zugrunde liegende Aufgabe verschiebt. Nichts davon ist kostenlos, und nichts davon verschwindet nach dem ersten Trainingslauf, wie es bei einer Prompt-Änderung der Fall ist.

Diese Verpflichtung sollten Sie dagegen abwägen, wie oft Agentic-AI-Projekte aus Gründen ins Stocken geraten, die nichts mit der reinen Leistungsfähigkeit des Modells zu tun haben. Gartner prognostiziert, dass über 40 % der Agentic-AI-Projekte bis Ende 2027 eingestellt werden, und nennt unter den wichtigsten Ursachen steigende Kosten und unklaren Geschäftsnutzen. Sich auf eine Fine-Tuning-Pipeline festzulegen, bevor Sie den Use Case mit einer günstigeren, schnelleren Methode belegt haben, ist ein guter Weg, einem Projekt Kosten und Komplexität aufzuladen, bevor Sie wissen, ob es funktioniert. Wenn Sie Plattformen unter diesem Gesichtspunkt vergleichen, bewerten unsere AI-Tool-Vergleiche Anbieter nach mehr als der reinen Modellqualität, und der Kaufleitfaden für AI-Chatbot-Plattformen geht genau diese Abwägung zwischen Prompting und Anpassung aus Käufersicht durch.

Wenn die Antwort wirklich „beides“ lautet

Nichts davon heißt, dass sich Fine-Tuning und Prompting über ein ganzes Agent-System hinweg gegenseitig ausschließen. Ein großer Agent mit vielen Schrittarten kann legitim ein feingetuntes kleines Modell für einen engen, repetitiven Klassifikationsschritt nutzen und ein gepromptetes, RAG-verankertes Frontier-Modell für die Reasoning- und Entwurfsschritte, die aktuelles Wissen und Urteilsvermögen brauchen. Wie Sie einen AI Agent bauen behandelt die sechs Bausteine, die jeder Agent braucht. Die Wahl zwischen Fine-Tuning und Prompting ist dabei keine einmalige Entscheidung, sondern eine Entscheidung pro Schritt, abhängig davon, was dieser konkrete Schritt tatsächlich verlangt.

Key Facts

  • Die Fine-Tuning-Leitlinien von OpenAI beginnen mit „gute Evals zuerst“: Schaffen Sie eine Möglichkeit zu messen, ob Fine-Tuning geholfen hat, bevor Sie investieren, nicht danach.
  • Fine-Tuning eignet sich am besten für Klassifikation, nuancierte Übersetzung, bestimmte Ausgabeformate und die Korrektur von Fehlern bei der Befolgung von Anweisungen, nicht um einem Modell neue oder sich häufig ändernde Fakten beizubringen.
  • Retrieval liest im Moment der Frage aus der Quelle und bildet Updates daher sofort ab. Ein feingetuntes Modell ist nur so aktuell wie sein letzter Trainingslauf.
  • Der häufigste legitime Einsatz von Fine-Tuning in einem Agent ist eine enge Teilaufgabe mit hohem Volumen, etwa Ticket-Klassifikation oder Feldextraktion aus Dokumenten, als ein Schritt, nicht als gesamter Reasoning-Prozess des Agents.
  • Gartner führt über 40 % der prognostizierten Abbrüche von Agentic-AI-Projekten bis 2027 teilweise auf steigende Kosten zurück, ein reales Risiko, wenn eine Fine-Tuning-Pipeline gebaut wird, bevor der Use Case belegt ist.

Häufig gestellte Fragen zu Fine-Tuning vs. Prompting für AI Agents

Sollte ich meinen AI Agent feintunen oder prompten?

Beginnen Sie bei fast jedem Agent-Use-Case mit Prompting, Retrieval und Tools. Fine-Tuning ist erst dann eine Überlegung wert, wenn ein gut geschriebener Prompt und gute Beispiele ein konkretes, enges Problem tatsächlich nicht gelöst haben, etwa ein uneinheitliches Ausgabeformat oder eine Klassifikationsaufgabe, die ein Prompt immer wieder falsch löst.

Was ist der Hauptunterschied zwischen Fine-Tuning und Prompting?

Prompting steuert das Verhalten eines Allzweckmodells in dem Moment, in dem es läuft, über Anweisungen, Beispiele und abgerufenen Kontext, und es lässt sich schnell ändern. Fine-Tuning trainiert ein Modell mit Ihren eigenen Daten weiter und passt seine Gewichte so an, dass ein Verhalten näher an einen Automatismus rückt. Es ist aber langsamer zu aktualisieren und erfordert eine fortlaufende Trainings- und Evaluierungspipeline.

Kann Fine-Tuning RAG ersetzen, um einen Agent aktuell zu halten?

Nein. Fine-Tuning verankert Wissen zum Zeitpunkt des Trainings in den Gewichten eines Modells, sodass es veraltet, sobald sich ein Quelldokument ändert. RAG ruft im Moment der Frage aus der Live-Quelle ab. Deshalb ist Retrieval, nicht Fine-Tuning, das richtige Werkzeug für Wissen, das sich regelmäßig ändert.

Welche Agent-Aufgaben eignen sich gut für Fine-Tuning?

Enge, repetitive Teilaufgaben mit hohem Volumen und konsistenter Eingabe- und Ausgabeform: Tickets in Warteschlangen einsortieren, strukturierte Felder aus unordentlichen Dokumenten extrahieren oder eine sehr bestimmte Tonalität oder ein Format zuverlässig treffen. Das ist meist ein Schritt innerhalb eines größeren Agents, nicht der gesamte Reasoning-Prozess des Agents.

Brauche ich Machine-Learning-Expertise, um ein Modell für einen Agent feinzutunen?

Für eine enge Aufgabe mit einem guten Datensatz brauchen Sie weniger, als man denkt. Sie brauchen aber trotzdem einen echten Evaluierungsprozess, um zu bestätigen, dass die feingetunte Version eine gut geprompte Alternative übertrifft. Evals zu überspringen ist der häufigste Weg, auf dem Teams bei einem feingetunten Modell landen, das nicht wirklich besser, sondern nur anders ist.

Wie es weitergeht

Wenn Prompting und Retrieval der richtige Ausgangspunkt für Ihren Agent sind, zeigt RAG für AI Agents, wie Sie ihn in Ihren eigenen Daten verankern, und Wie Sie einen AI Agent bauen zeigt, wo diese Entscheidung unter den übrigen Bausteinen eines Agents steht. Wenn die Kosten ein Grund sind, der Sie zum Fine-Tuning drängt, behandelt AI-Agent-Kostenoptimierung Caching und Model Routing, zwei Hebel, die oft dasselbe Problem ohne Trainingspipeline lösen.

About the author

Victor Hoang

Victor Hoang

Co-Founder, Rework.com

Victor Hoang is Co-Founder and CMO of Rework. He spent 12+ years scaling B2B SaaS growth, building a lead engine that generated over 1 million leads and $10M+ in annual recurring revenue. Today he builds AI agents and MCP servers into Rework's products to empower customers across growth and operations. He writes about what actually works.