xAI hat am 07.08.2026 Imagine Image 2.0 veröffentlicht. Das Modell verschiebt den Schwerpunkt von der Bildgenerierung zur Bildbearbeitung: es verarbeitet bis zu fünf Referenzbilder gleichzeitig, entfernt Hintergründe, segmentiert Bildbereiche und ändert einzelne Elemente über eine Werkzeugfunktion, ohne den Rest des Bildes neu zu erzeugen (xAI).
Verfügbar ist das Modell über grok.com/imagine, die Apps für iOS und Android sowie die Programmierschnittstelle unter der Bezeichnung grok-imagine-image-2.0. Preise nennt xAI in der Ankündigung nicht, ebenso keine konkreten Pixelauflösungen.
Was Multi-Referenz praktisch löst
Der häufigste Grund, weshalb KMU generierte Bilder nicht verwenden können, ist fehlende Konsistenz. Das Produkt sieht im zweiten Bild anders aus als im ersten, die Farbe stimmt nicht, das Material wirkt falsch. Für Marketing ist ein einzelnes gutes Bild wertlos, wenn die Serie nicht zusammenpasst.
Mit fünf Referenzbildern lassen sich Rolle und Funktion getrennt vorgeben: eines für das Produkt, eines für die Lichtstimmung, eines für den Hintergrund, eines für die Farbwelt, eines für den Bildaufbau. Das ist näher an einem Briefing für eine Fotografin als an einer Textanweisung und liefert deshalb reproduzierbarere Ergebnisse.
Ergänzend nennt xAI konsistente Welten, Vorlagen sowie ein intelligentes Anpassen des Bildformats. Letzteres ist im Alltag der unterschätzte Punkt, weil dasselbe Motiv für Website, Newsletter und Social Media in unterschiedlichen Seitenverhältnissen gebraucht wird und ein reiner Beschnitt die Bildaussage regelmässig zerstört.
Was das Werkzeug nicht ersetzt
Zwei Grenzen sind vor dem produktiven Einsatz relevant. Erstens ersetzt Bildbearbeitung keine Produktfotografie, wenn das Produkt technisch exakt dargestellt werden muss. Bei Maschinen, Bauteilen und Beschichtungen führen generierte Details zu falschen Aussagen, und im Verkauf sind falsche Details ein Haftungsthema, kein Gestaltungsthema.
Zweitens fehlen in der Ankündigung Angaben zu Preisen und zur kommerziellen Nutzung im Detail. Wer Bilder in Offerten, Katalogen oder Werbung einsetzt, klärt die Nutzungsrechte vor der Produktion und nicht nach der Veröffentlichung.
Drei Anwendungen mit Freigabepunkt
1. Freistellen für den Onlineshop. Vorhandene Produktfotos auf einheitlichen Hintergrund bringen. Das Produkt bleibt echt, nur der Hintergrund wird ersetzt. Das ist der sauberste Einsatz, weil keine Produkteigenschaft erfunden wird.
2. Stimmungsbilder für Website und Newsletter. Kein Produktbezug, sondern Atmosphäre. Hier ist generative Bearbeitung unkritisch und ersetzt teure Bildlizenzen. Der Freigabepunkt liegt bei der Markenkonformität, also der Frage, ob Farbwelt und Bildsprache zum Auftritt passen.
3. Formatanpassung bestehender Bildwelten. Ein bestehendes Bildmotiv in weitere Seitenverhältnisse überführen, ohne den Bildaufbau zu verlieren. Der Prüfschritt ist visuell: Bildkern erhalten oder verschoben.
Referenzbilder aufbauen statt Prompts sammeln
Wer mit fünf Referenzbildern arbeitet, braucht diese Bilder zuerst. Der Aufwand liegt damit einmalig in der Vorbereitung und nicht wiederholt in der Beschreibung. Fünf Dateien genügen als Grundausstattung: ein sauberes Produktbild vor neutralem Hintergrund, eine typische Lichtsituation aus dem eigenen Betrieb, ein Hintergrund, der zum Auftritt passt, ein Bild mit der verbindlichen Farbwelt und ein Beispiel für den gewünschten Bildaufbau.
Diese Sammlung ist übertragbar. Sie funktioniert bei einem Anbieterwechsel weiter, weil sie aus eigenen Dateien besteht und nicht aus modellspezifischen Anweisungen. Genau darin liegt der Unterschied zwischen einer Bildsprache und einer Sammlung von Prompts, die mit der nächsten Modellversion an Wirkung verliert.
Kennzeichnung mitdenken
Wer generierte oder generativ bearbeitete Bilder in der Kundenkommunikation einsetzt, bewegt sich im Geltungsbereich der Transparenzanforderungen, sobald EU-Kundschaft betroffen ist. Für die Schweiz gilt das revidierte Datenschutzgesetz bei Personenabbildungen, unabhängig von der Erzeugungsart.
Praktisch bedeutet das drei Festlegungen: welche Bildkategorien generativ entstehen dürfen, wo ein Hinweis gesetzt wird, und wer die Freigabe erteilt. Eine Ablage mit Ausgangsdateien, verwendeten Referenzen und Freigabedatum genügt als Nachweis und ist mit wenig Aufwand zu führen.
Einordnung
Der Markt für Bildmodelle verschiebt sich sichtbar von der Erzeugung zur kontrollierten Bearbeitung. Für Betriebe ist das die relevantere Entwicklung, weil der Engpass nie im Erzeugen lag, sondern in der Wiederholbarkeit und in der Markenkonformität.
Die Werkzeugwahl bleibt dabei zweitrangig. Wer eine dokumentierte Bildsprache mit definierten Referenzen und einem Freigabeschritt hat, erzielt mit jedem der aktuellen Modelle brauchbare Ergebnisse. Wer diese Grundlage nicht hat, erzeugt mit dem besten Modell inkonsistente Bilder in höherer Geschwindigkeit.
Wie markenkonforme Visuals mit einem anderen Modell entstehen, zeigt der Beitrag Midjourney V8.2 für markenkonforme Visuals: 3 KMU-Szenarien. Systematische Bildwelten und Prompt-Kategorien behandelt Midjourney für KMU-Marketing: 12 Prompt-Kategorien und Marken-Bildwelt.
Nächster Schritt
Im Erstgespräch definieren wir Ihre Referenzbilder, legen fest, welche Bildkategorien generativ entstehen dürfen, und formulieren die Bearbeitungsanweisungen passend zu Ihrem Auftritt. Erstgespräch vereinbaren.
