यह क्या है?
AI इमेज जनरेशन टेक्स्ट विवरण से तस्वीरें बनाता और संपादित करता है। यह जनरेटिव AI की पहली वायरल कामयाबी थी, और अगुवाई अब 'क्या यह बना सकता है?' से सटीक संपादन की ओर बढ़ चुकी है: एक चीज़ बदलो, बाक़ी सब वैसा ही रखो, पढ़ने लायक़ टेक्स्ट बनाओ, शृंखला में एकरूपता रखो।
प्रमुख उपकरण और खिलाड़ी
- Midjourney — सौंदर्य का पैमाना
- FLUX (Black Forest Labs) — सबसे मज़बूत ओपन-वेट परिवार, कई ऐप्स की रीढ़ (हमारा भी)
- Google के इमेज मॉडल — 'Nano Banana' नाम से वायरल हुआ संवादी संपादन
- DALL·E / GPT image (OpenAI) — ChatGPT के भीतर इमेज जनरेशन
- Stable Diffusion — वह ओपन-सोर्स परियोजना जिसने सब कुछ सुलभ किया
- Adobe Firefly — Photoshop के भीतर व्यावसायिक रूप से सुरक्षित जनरेशन
मील के पत्थर
- 2021 — DALL·E ने दिखाया कि टेक्स्ट-से-इमेज संभव है
- 2022 — Stable Diffusion ने इसे ओपन-सोर्स किया; Midjourney ने सुंदर बनाया; एक AI तस्वीर ने कला मेला जीता
- 2023 — फ़ोटोयथार्थ आया; 'AI हाथों' की समस्या घटी
- 2024 — FLUX ने ओपन-वेट का स्तर उठाया; तस्वीर के भीतर का टेक्स्ट पढ़ने लायक़ हुआ
- 2025 — संवादी संपादन वायरल; उद्गम लेबल (C2PA) फैले
- 2026 — एक-जैसे किरदार की शृंखला और सटीक लेआउट नियंत्रण परिपक्व
- अग॰ 2026 — स्रोत-प्रमाण कानून बना: EU और कैलिफ़ोर्निया ने एक ही हफ्ते में मशीन-पठनीय AI लेबल (C2PA) अनिवार्य किए
- अग 2026 — गूगल ने दिखने वाला एआई बैज वैकल्पिक किया, उन यूरोपीय संघ और दक्षिण कोरिया को छोड़कर जहां यह कानूनन अनिवार्य है; अदृश्य SynthID और C2PA बने रहेंगे
मिनी शब्दकोश
- डिफ़्यूज़न: बेतरतीब पिक्सेलों का शोर धीरे-धीरे हटाकर छवि बनाना
- इनपेंटिंग: छवि के केवल चुने हुए हिस्से को दोबारा बनाना
- LoRA: मॉडल को कोई ख़ास शैली या चेहरा सिखाने वाला छोटा ऐड-ऑन