Blog · 22. September 2026 · 6 Min. Lesezeit

2 Bilder kombinieren mit KI: Ablauf, Beispiel, Grenzen

2 Bilder mit KI kombinieren: ein Ablauf mit Beispiel-Prompt, einem prüfbaren Ergebnis und den Grenzen aktueller Bildwerkzeuge – Schritt für Schritt erklärt.

Zwei Bilder, ein Ziel. Rollen klar vergeben. Nahtstelle prüfen.

„2 Bilder mit KI kombinieren" bezeichnet eine bestimmte Aufgabe: zwei eigene Bilder in ein Chat-Werkzeug hochladen und in einem Prompt beschreiben, wie beide zu einem neuen, dritten Bild verschmelzen sollen — etwa ein Produkt aus dem einen Foto vor die Szene aus dem anderen setzen. Das ist etwas anderes als eine Collage, bei der beide Bilder unverändert nebeneinanderstehen. Der ehrliche Punkt zuerst: Das Ergebnis ist immer eine komplett neu gezeichnete Version, keine pixelgenaue Montage der beiden Originale. Was aus welchem Bild übernommen wird, entscheidet der Prompt — nicht automatisch das, was am wichtigsten wirkt.

Wofür sich das im Büroalltag eignet

  • Ein Produktfoto mit einem Stimmungs- oder Hintergrundbild kombinieren, um das Produkt in einer neuen Umgebung zu zeigen, ohne einen neuen Fototermin zu buchen.
  • Ein Firmenlogo in ein bestehendes Eventfoto einsetzen, für einen Social-Media-Beitrag oder eine Folie.
  • Zwei Referenzbilder zu einer gemeinsamen Bildidee zusammenführen, um dem Team ein Konzept zu zeigen, bevor eine echte Fotoproduktion beauftragt wird.
  • Ein Objekt aus einem Foto vor einen anderen, passenderen Hintergrund setzen, etwa für eine Präsentationsfolie mit einheitlichem Bildstil.

Nicht geeignet ist es für alles, wo beide Quellbilder exakt so erkennbar bleiben müssen, wie sie aufgenommen wurden — ein Produktfoto für ein Exposé mit echten Maßen, ein Beweisfoto, ein Bild für eine offizielle Dokumentation. Und nicht geeignet ist es, um das Foto einer identifizierbaren Person ohne deren ausdrückliche Zustimmung in ein anderes Bild zu setzen, egal wie plausibel das Ergebnis aussieht.

Ein Ablauf, der das Ergebnis nachvollziehbar hält

  1. Wähl zwei Bilder mit klarer Rollenverteilung — eines liefert das Hauptmotiv, das andere nur Hintergrund oder Stil. Zwei gleichwertige Hauptmotive im selben Bild führen deutlich häufiger zu einem wirren Ergebnis.
  2. Schneide beide Bilder vorab auf den relevanten Ausschnitt zu, statt das komplette Originalfoto hochzuladen — ein überladener Hintergrund im Ausgangsbild taucht sonst gelegentlich als ungewolltes Detail im Ergebnis wieder auf.
  3. Beschreibe in einem Satz, was aus welchem Bild übernommen werden soll: „nimm das Produkt aus Bild eins und setze es vor den Hintergrund aus Bild zwei" liefert ein anderes Ergebnis als „kombiniere die beiden Bilder".
  4. Erzeuge mehrere Varianten desselben Prompts, bevor du dich für eine entscheidest — Beleuchtung und Perspektive der beiden Quellbilder werden nicht immer gleich gut angeglichen.
  5. Vergrößere das Ergebnis gezielt an der Nahtstelle zwischen beiden Motiven: Schattenwurf, Kantenübergänge und jeder Text oder jedes Logo, das aus einem der beiden Originale übernommen wurde.

Ein Beispiel von Anfang bis Ende

Nimm ein Produktfoto vor weißem Studiohintergrund, das in einer Präsentation vor einer passenden Büroszene stehen soll. Prompt unvollständig: „Kombiniere Bild eins und Bild zwei." Ergebnis: Produkt und Hintergrund wirken jeder für sich stimmig, aber Lichtrichtung und Schattenwurf passen nicht zusammen, und am Übergang zum Boden scheint das Produkt leicht zu schweben.

Prompt vollständig: „Nimm das Produkt aus Bild eins unverändert in Form und Farbe und setze es auf den Tisch aus Bild zwei. Passe Schatten und Lichtrichtung an die Szene aus Bild zwei an." Das Ergebnis lässt sich meist direkt verwenden, weil der Prompt festlegt, welches Bild das Motiv liefert und welches nur die Umgebung — und weil die Anpassung von Schatten und Licht ausdrücklich verlangt wurde, statt dem Modell überlassen zu bleiben.

Ein zweites Beispiel zeigt eine engere Aufgabe: ein Firmenlogo soll unten rechts in ein Eventfoto eingebettet werden. Prompt unvollständig: „Füge das Logo ins Foto ein." Ergebnis: Das Logo wirkt leicht gestaucht und bekommt einen Schlagschatten, den es im Original nicht hatte. Prompt vollständig: „Füge das Logo aus Bild zwei unverändert in Form, Farbe und Schriftzug unten rechts in das Foto aus Bild eins ein, ohne Schatten oder Perspektivenverzerrung." Prüfbar ist das direkt: den Logo-Schriftzug im Ergebnis vergrößern und Buchstabe für Buchstabe neben dem Original halten.

Wo die Werkzeuggrenzen liegen

Aktuelle Bild-KI in Chat-Anwendungen wie Gemini oder ChatGPT erlaubt es, mehrere Bilder gleichzeitig hochzuladen und in einem Prompt zu beschreiben, wie sie zusammengeführt werden sollen — meist zwei bis wenige Bilder pro Anfrage, je nach Werkzeug und Abo. Trotzdem ist das Ergebnis keine pixelgenaue Montage: Perspektive, Lichtfarbe und Bildschärfe der beiden Quellbilder werden angeglichen, nicht einfach übernommen, und ein feines Detail aus dem Original — ein bestimmtes Muster, ein exakter Farbton, ein kleines Element im Hintergrund — geht dabei gelegentlich verloren oder wird durch eine plausible, aber andere Version ersetzt.

Ein zweiter Punkt betrifft Text und Logos: Ein Schriftzug aus einem der beiden Quellbilder wird beim Zusammenführen genauso neu gezeichnet wie der Rest des Bildes und gerät dabei leichter durcheinander als eine glatte Fläche — ein Grund mehr, jeden übernommenen Text im Ergebnis einzeln zu lesen statt nur zu überfliegen. Und wer ein fremdes Foto oder Logo als zweites Bild verwendet, sollte vorher klären, ob die Rechte daran die Weiterverarbeitung erlauben — das gilt für ein Kundenlogo genauso wie für ein Stockfoto mit eigenen Lizenzbedingungen.

Ein dritter Punkt betrifft Format und Auflösung: Die beiden Quellbilder müssen nicht dasselbe Seitenverhältnis haben, aber das Ergebnis übernimmt selten automatisch das Format, das später gebraucht wird — für eine Folie im 16:9-Format oder ein quadratisches Social-Media-Bild lohnt es sich, das Zielformat im Prompt ausdrücklich zu nennen, statt ein Ergebnis im falschen Format nachträglich zuzuschneiden. Und weil jede neue Variante das gesamte Bild neu erzeugt, bleibt zwischen zwei Anläufen selten mehr als der grobe Bildaufbau gleich — ein Grund, kleinere Korrekturen in einem Folgeprompt gezielt zu benennen, statt bei jeder Kleinigkeit ganz von vorn zu beginnen.

Wie verbreitet solche Werkzeuge im Job bereits sind

Der Bitkom erhebt regelmäßig, wie viele deutsche Unternehmen generative KI-Bildwerkzeuge inzwischen für Präsentationen, Marketing oder interne Unterlagen einsetzen. Welche Bildbearbeitungsaufgaben sich davon technisch überhaupt automatisieren lassen, untersucht laufend das IAB.

Dass ein Mensch das Ergebnis prüft, bevor es verwendet wird, gilt für ein kombiniertes Bild genauso wie für jeden anderen KI-generierten Inhalt — die OECD-Leitlinien zu KI benennen diese Prüfverantwortung ausdrücklich. Wie schnell sich diese Modelle technisch weiterentwickeln, verfolgt der Stanford AI Index über mehrere Jahre — die Fähigkeiten wachsen sichtbar, was ein Ergebnis überzeugender aussehen lässt, ohne dass eine ausdrückliche Rollenverteilung im Prompt dadurch überflüssig würde.

Genau diese Prüfroutine — ein Ergebnis gegen die eigene Vorgabe abgleichen, statt es wegen des ersten Eindrucks zu übernehmen — ist Teil dessen, wofür der Arbeitsmarkt laut PwC AI Jobs Barometer einen deutlichen Gehaltsaufschlag zahlt, unabhängig davon, ob die Aufgabe ein Bild, ein Text oder eine Tabelle ist.

Was du am Montag ausprobierst

  1. Wähl zwei eigene Bilder mit klarer Rollenverteilung — eines als Hauptmotiv, eines als Hintergrund oder Stilvorlage.
  2. Schreib einen Prompt, der ausdrücklich benennt, welches Bild was liefert, statt nur „kombiniere beide".
  3. Erzeuge mindestens zwei Varianten und vergleiche sie nebeneinander.
  4. Vergrößere das Ergebnis an der Nahtstelle zwischen beiden Motiven und an jedem übernommenen Text oder Logo, bevor du es verwendest.

Dieselbe Rollenverteilung im Prompt — genau festlegen, was bleiben soll und was sich ändern darf — gilt auch, wenn nur ein einzelnes Foto angepasst statt zwei zusammengeführt wird: dazu mehr in ChatGPT Fotos bearbeiten und in Bilder verbessern mit KI für Schärfe und Belichtung. Soll eines der beiden Bilder eine komplett neu erzeugte Person statt eines echten Fotos zeigen, gilt die Zustimmungsregel aus KI Menschen Bilder. Für ein komplett neu erzeugtes Bild ganz ohne Vorlage zeigt Flux KI denselben Prompt-und-Prüf-Ablauf, und landet das kombinierte Bild am Ende in einem Flyer, gilt dieselbe Prüfregel zusätzlich für die Pflichtangaben — dazu mehr in Flyer erstellen mit KI.

Der Prüfschritt selbst ist derselbe wie bei jeder anderen KI-Aufgabe im Büro, ausführlicher beschrieben in KI im Büro.

Genau diese Fähigkeit — eine Rollenverteilung präzise vorgeben und das Ergebnis gegen beide Originale prüfen — vermittelt Coursium in kurzen Lektionen fürs Handy. Bleib der KI voraus mit Übungen, die zu einer echten Aufgabe passen, nicht zu einem Demo-Beispiel. Mehr zu diesem Ansatz steht über Coursium.

Coursium

Bleib der KI voraus — lern die Tools auf dem Handy.

App holen