15/01/2024
DALL·E, DALL·E 2, এবং DALL·E 3 হল টেক্সট-টু-ইমেজ মডেল যা ওপেনএআই দ্বারা তৈরি করা হয়েছে গভীর শিক্ষার পদ্ধতি ব্যবহার করে প্রাকৃতিক ভাষার বর্ণনা থেকে ডিজিটাল ছবি তৈরি করার জন্য, যাকে "প্রম্পট" বলা হয়।
DALL·E 3 নেটিভভাবে ChatGPT প্লাস এবং ChatGPT এন্টারপ্রাইজ গ্রাহকদের জন্য 2023 সালের অক্টোবরে প্রকাশ করা হয়েছিল, নভেম্বরের প্রথম দিকে OpenAI এর API এবং "ল্যাবস" প্ল্যাটফর্মের মাধ্যমে উপলব্ধতা সহ। মাইক্রোসফ্ট বিং এর ইমেজ ক্রিয়েটর টুলে মডেলটি বাস্তবায়ন করেছে এবং তাদের ডিজাইনার অ্যাপে এটি বাস্তবায়নের পরিকল্পনা করেছে।
ইতিহাস এবং পটভূমি
DALL·E 5 জানুয়ারী 2021 সালে একটি ব্লগ পোস্টে OpenAI দ্বারা প্রকাশ করা হয়েছিল এবং ছবি তৈরি করতে GPT-3-এর পরিবর্তিত সংস্করণ ব্যবহার করে।
6 এপ্রিল 2022-এ, OpenAI DALL·E 2 ঘোষণা করেছে, একটি উত্তরসূরী যা উচ্চতর রেজোলিউশনে আরও বাস্তবসম্মত ছবি তৈরি করার জন্য ডিজাইন করা হয়েছে যা "ধারণা, বৈশিষ্ট্য এবং শৈলীকে একত্রিত করতে পারে"। 20 জুলাই 2022-এ, DALL·E 2 1 মিলিয়ন অপেক্ষমাণ তালিকাভুক্ত ব্যক্তিকে পাঠানো আমন্ত্রণ সহ একটি বিটা পর্যায়ে প্রবেশ করেছে; ব্যবহারকারীরা প্রতি মাসে বিনামূল্যে একটি নির্দিষ্ট সংখ্যক ছবি তৈরি করতে পারে এবং আরও কিনতে পারে। নৈতিকতা এবং নিরাপত্তার বিষয়ে উদ্বেগের কারণে গবেষণা পূর্বরূপের জন্য আগে থেকে নির্বাচিত ব্যবহারকারীদের জন্য অ্যাক্সেস সীমাবদ্ধ ছিল। 28 সেপ্টেম্বর 2022-এ, DALL·E 2 সবার জন্য উন্মুক্ত করা হয়েছিল এবং অপেক্ষা তালিকার প্রয়োজনীয়তা সরিয়ে দেওয়া হয়েছিল। 2023 সালের সেপ্টেম্বরে, OpenAI তাদের সর্বশেষ চিত্রের মডেল, DALL·E 3 ঘোষণা করেছে, যা পূর্ববর্তী পুনরাবৃত্তির তুলনায় "উল্লেখযোগ্যভাবে আরও সূক্ষ্মতা এবং বিশদ" বুঝতে সক্ষম। 2022 সালের নভেম্বরের শুরুতে, OpenAI DALL·E 2কে API হিসেবে প্রকাশ করেছে, যা ডেভেলপারদের তাদের নিজস্ব অ্যাপ্লিকেশনে মডেলটিকে একীভূত করতে দেয়। মাইক্রোসফ্ট তাদের ডিজাইনার অ্যাপ এবং বিং এবং মাইক্রোসফ্ট এজ-এর অন্তর্ভুক্ত ইমেজ ক্রিয়েটর টুলে DALL·E 2-এর বাস্তবায়ন উন্মোচন করেছে। এপিআই একটি খরচ-প্রতি-চিত্রের ভিত্তিতে কাজ করে, যার দাম ছবির রেজোলিউশনের উপর নির্ভর করে পরিবর্তিত হয়। ওপেনএআই-এর এন্টারপ্রাইজ টিমের সাথে কাজ করা কোম্পানিগুলির জন্য ভলিউম ডিসকাউন্ট পাওয়া যায়।
সফ্টওয়্যারটির নামটি অ্যানিমেটেড রোবট পিক্সার চরিত্র ওয়াল-ই এবং স্প্যানিশ পরাবাস্তববাদী শিল্পী সালভাদর দালির নামের একটি পোর্টম্যানটিউ।
প্রযুক্তি
প্রথম জেনারেটিভ প্রি-ট্রেনড ট্রান্সফরমার (GPT) মডেলটি প্রাথমিকভাবে 2018 সালে OpenAI দ্বারা ট্রান্সফরমার আর্কিটেকচার ব্যবহার করে তৈরি করা হয়েছিল। প্রথম পুনরাবৃত্তি, GPT-1, 2019 সালে GPT-2 তৈরির জন্য স্কেল করা হয়েছিল; 2020 সালে, 175 বিলিয়ন প্যারামিটার সহ GPT-3 তৈরির জন্য এটিকে আবার স্কেল করা হয়েছিল।
DALL·E-এর মডেল হল 12 বিলিয়ন প্যারামিটার সহ GPT-3-এর একটি মাল্টিমোডাল বাস্তবায়ন যা "পিক্সেলের জন্য পাঠ্য অদলবদল করে", ইন্টারনেট থেকে পাঠ্য-ইমেজ জোড়ার উপর প্রশিক্ষিত। বিস্তারিতভাবে, ট্রান্সফরমার মডেলের ইনপুট হল টোকেনাইজড ইমেজ ক্যাপশনের একটি ক্রম এবং টোকেনাইজড ইমেজ প্যাচ। ছবির ক্যাপশনটি ইংরেজিতে, বাইট জোড়া এনকোডিং দ্বারা টোকেনাইজড (শব্দভান্ডারের আকার 16384), এবং 256 টোকেন পর্যন্ত দীর্ঘ হতে পারে। প্রতিটি চিত্র একটি 256×256 RGB চিত্র, প্রতিটি 4×4 এর 32×32 প্যাচে বিভক্ত। প্রতিটি প্যাচ তারপর একটি পৃথক বৈচিত্রপূর্ণ অটোএনকোডার দ্বারা একটি টোকেনে রূপান্তরিত হয় (শব্দভান্ডার আকার 8192)।
DALL·E CLIP (কন্ট্রাস্টিভ ল্যাঙ্গুয়েজ-ইমেজ প্রাক-প্রশিক্ষণ) এর সাথে একযোগে জনসাধারণের কাছে বিকশিত এবং ঘোষণা করা হয়েছিল। CLIP হল শূন্য-শট শিক্ষার উপর ভিত্তি করে একটি পৃথক মডেল যা টেক্সট ক্যাপশন সহ 400 মিলিয়ন জোড়া ছবিতে প্রশিক্ষিত হয়েছিল ইন্টারনেট এর ভূমিকা হল DALL·E-এর আউটপুটকে "বুঝতে এবং র্যাঙ্ক করা" যা ডেটাসেট থেকে এলোমেলোভাবে নির্বাচিত 32,768টি ক্যাপশনের তালিকা থেকে কোনটি চিত্রের জন্য সবচেয়ে উপযুক্ত (যার মধ্যে একটি সঠিক উত্তর ছিল) অনুমান করা। এই মডেলটি সবচেয়ে উপযুক্ত আউটপুট নির্বাচন করতে DALL·E দ্বারা উত্পন্ন চিত্রগুলির একটি বৃহত্তর প্রাথমিক তালিকা ফিল্টার করতে ব্যবহৃত হয়।
DALL·E 2 3.5 বিলিয়ন প্যারামিটার ব্যবহার করে, যা এর পূর্বসূরির তুলনায় একটি ছোট সংখ্যা। DALL·E 2 CLIP ইমেজ এম্বেডিং-এ শর্তযুক্ত একটি ডিফিউশন মডেল ব্যবহার করে, যা অনুমানের সময়, একটি পূর্বের মডেল দ্বারা CLIP টেক্সট এম্বেডিং থেকে তৈরি হয়।
কনট্রাস্টিভ ল্যাঙ্গুয়েজ-ইমেজ প্রাক-প্রশিক্ষণ (CLIP)
কনট্রাস্টিভ ল্যাঙ্গুয়েজ-ইমেজ প্রাক-প্রশিক্ষণ হল একজোড়া মডেলকে প্রশিক্ষণ দেওয়ার একটি কৌশল। একটি মডেল পাঠ্যের একটি অংশ নেয় এবং একটি একক ভেক্টর আউটপুট করে। অন্য একটি চিত্র নেয় এবং একটি একক ভেক্টর আউটপুট করে।
এই ধরনের একজোড়া মডেলকে প্রশিক্ষণ দেওয়ার জন্য, কেউ ইমেজ-ক্যাপশন জোড়ার একটি বড় ডেটাসেট প্রস্তুত করে শুরু করবে, তারপর আকারের নমুনা ব্যাচগুলি I
ক্ষমতা
DALL·E ফটোরিয়ালিস্টিক ছবি, পেইন্টিং এবং ইমোজি সহ একাধিক শৈলীতে চিত্র তৈরি করতে পারে। এটি তার চিত্রগুলিতে বস্তুগুলিকে "নিপুন ও পুনর্বিন্যাস" করতে পারে এবং সুস্পষ্ট নির্দেশ ছাড়াই উপন্যাসের রচনাগুলিতে নকশা উপাদানগুলি সঠিকভাবে স্থাপন করতে পারে। BoingBoing-এর জন্য লেখা থম ডান মন্তব্য করেছেন যে "উদাহরণস্বরূপ, যখন একটি ডাইকন মূলা আঁকতে বলা হয় নাক ফুঁকিয়ে, একটি ল্যাটে চুমুক দিয়ে, বা একটি ইউনিসাইকেল চালাতে, তখন DALL·E প্রায়শই রুমাল, হাত এবং পাকে যুক্তিযুক্ত স্থানে আঁকেন।" DALL·E নির্দিষ্ট প্রম্পট ছাড়াই উপযুক্ত বিশদ অনুমান করার জন্য "শূন্যস্থান পূরণ" করার ক্ষমতা দেখিয়েছে, যেমন সাধারণত উদযাপনের সাথে যুক্ত প্রম্পটে ক্রিসমাস ইমেজ যোগ করা এবং সেগুলি উল্লেখ করেনি এমন চিত্রগুলিতে যথাযথভাবে ছায়া স্থাপন করা। উপরন্তু, DALL·E ভিজ্যুয়াল এবং ডিজাইনের প্রবণতাগুলির একটি বিস্তৃত বোঝাপড়া প্রদর্শন করে।[উদ্ধৃতি প্রয়োজন]
DALL·E শুধুমাত্র বিরল ব্যর্থতার সাথে বিভিন্ন দৃষ্টিভঙ্গি থেকে বিভিন্ন ধরণের নির্বিচারে বর্ণনার জন্য চিত্র তৈরি করতে পারে। মার্ক রিডল, জর্জিয়া টেক স্কুল অফ ইন্টারেক্টিভ কম্পিউটিং-এর একজন সহযোগী অধ্যাপক, আবিষ্কার করেছেন যে DALL-E ধারণাগুলিকে মিশ্রিত করতে পারে (মানুষের সৃজনশীলতার মূল উপাদান হিসাবে বর্ণনা করা হয়েছে)।
এর চাক্ষুষ যুক্তির ক্ষমতা Raven's Matrices (বুদ্ধিমত্তা পরিমাপ করার জন্য প্রায়ই মানুষের কাছে চাক্ষুষ পরীক্ষা করা হয়) সমাধান করার জন্য যথেষ্ট।
টেক্সট প্রম্পটের উপর ভিত্তি করে DALL·E 3 দ্বারা উত্পন্ন নির্ভুল পাঠ্যের একটি চিত্র "একজন থেরাপিস্টের চেয়ারে বসে থাকা একটি অ্যাভোকাডোর একটি চিত্র, যেটির কেন্দ্রে একটি গর্ত-আকারের গর্ত আছে 'আমি ভিতরে খুব খালি অনুভব করছি'। থেরাপিস্ট, একটি চামচ, স্ক্রীবল নোট।"
DALL·E 3 তার পূর্বসূরীদের তুলনায় আরো নির্ভুলতা এবং বিশদ সহ জটিল প্রম্পট অনুসরণ করে এবং আরও সুসঙ্গত এবং নির্ভুল পাঠ্য তৈরি করতে সক্ষম। DALL·E 3 ChatGPT প্লাসে একত্রিত হয়েছে।
ইমেজ পরিবর্তন
DALL·E 2 দিয়ে তৈরি গার্ল উইথ এ পার্ল ইয়ারিং-এর দুটি "ভেরিয়েশন"
একটি বিদ্যমান চিত্রের প্রেক্ষিতে, DALL·E 2 মূলের উপর ভিত্তি করে পৃথক আউটপুট হিসাবে চিত্রটির "বৈচিত্র্য" তৈরি করতে পারে, সেইসাথে এটিকে সংশোধন বা প্রসারিত করতে চিত্রটিকে সম্পাদনা করতে পারে। DALL·E 2 এর "ইনপেইন্টিং" এবং "আউটপেইন্টিং" একটি প্রদত্ত প্রম্পট অনুসরণ করে, আসলটির সাথে সামঞ্জস্যপূর্ণ একটি মাধ্যম ব্যবহার করে অনুপস্থিত জায়গাগুলি পূরণ করতে একটি চিত্র থেকে প্রসঙ্গ ব্যবহার করে।
উদাহরণস্বরূপ, এটি একটি ছবিতে একটি নতুন বিষয় সন্নিবেশ করতে ব্যবহার করা যেতে পারে, বা একটি চিত্রকে তার মূল সীমানার বাইরে প্রসারিত করতে পারে৷ OpenAI-এর মতে, "আউটপেইন্টিং মূল ছবির প্রেক্ষাপট বজায় রাখার জন্য - ছায়া, প্রতিফলন এবং টেক্সচার সহ - ছবির বিদ্যমান ভিজ্যুয়াল উপাদানগুলিকে বিবেচনা করে।
প্রযুক্তিগত সীমাবদ্ধতা
DALL·E 2 এর ভাষা বোঝার সীমা আছে। এটি কখনও কখনও "একটি লাল বই এবং একটি লাল দানি" থেকে "একটি লাল বই এবং একটি হলুদ দানি" বা "পান্ডা তৈরির ল্যাটে আর্ট" থেকে "একটি পান্ডা তৈরি করে" আলাদা করতে অক্ষম। এটি "একজন মহাকাশচারী একটি ঘোড়ায় চড়ে" এর চিত্র তৈরি করে যখন "একজন মহাকাশচারীকে ঘোড়ায় চড়ে" প্রম্পট দিয়ে উপস্থাপন করা হয়। এটি বিভিন্ন পরিস্থিতিতে সঠিক চিত্র তৈরি করতেও ব্যর্থ হয়। তিনটির বেশি অবজেক্ট, নেগেশান, সংখ্যা এবং সংযুক্ত বাক্য অনুরোধ করলে ভুল হতে পারে এবং ভুল বস্তুতে অবজেক্টের বৈশিষ্ট্য দেখা যেতে পারে। অতিরিক্ত সীমাবদ্ধতার মধ্যে রয়েছে পাঠ্য পরিচালনা করা - যা এমনকি সুপাঠ্য অক্ষর দিয়েও, প্রায় সবসময়ই স্বপ্নের মতো বিভ্রান্তিতে পরিণত হয় - এবং জ্যোতির্বিদ্যা বা চিকিৎসা চিত্রের মতো বৈজ্ঞানিক তথ্য সম্বোধন করার সীমিত ক্ষমতা।
নৈতিক উদ্বেগ
পাবলিক ডেটাসেটের উপর DALL·E 2-এর নির্ভরতা এর ফলাফলগুলিকে প্রভাবিত করে এবং কিছু ক্ষেত্রে অ্যালগরিদমিক পক্ষপাতের দিকে পরিচালিত করে, যেমন লিঙ্গ উল্লেখ না করে এমন অনুরোধের জন্য মহিলাদের তুলনায় পুরুষদের বেশি সংখ্যা তৈরি করা। DALL·E 2-এর প্রশিক্ষণের ডেটা হিংসাত্মক এবং যৌন চিত্র অপসারণের জন্য ফিল্টার করা হয়েছিল, কিন্তু এটি কিছু ক্ষেত্রে পক্ষপাত বাড়াতে দেখা গেছে যেমন মহিলাদের তৈরি হওয়ার ফ্রিকোয়েন্সি হ্রাস করা। ওপেনএআই অনুমান করে যে এটি হতে পারে কারণ প্রশিক্ষণের ডেটাতে মহিলাদের যৌনতার সম্ভাবনা বেশি ছিল যার ফলে ফিল্টার ফলাফলগুলিকে প্রভাবিত করে। 2022 সালের সেপ্টেম্বরে, ওপেনএআই দ্য ভার্জকে নিশ্চিত করেছে যে DALL·E ফলাফলে পক্ষপাত দূর করতে ব্যবহারকারীর প্রম্পটে অদৃশ্যভাবে বাক্যাংশ সন্নিবেশ করায়; উদাহরণস্বরূপ, "কালো পুরুষ" এবং "এশীয় মহিলা" প্রম্পটে ঢোকানো হয় যা লিঙ্গ বা জাতি নির্দিষ্ট করে না।
DALL·E 2 এবং অনুরূপ ইমেজ জেনারেশন মডেল সম্পর্কে একটি উদ্বেগ হল যে এগুলি ডিপফেক এবং অন্যান্য ধরণের ভুল তথ্য প্রচার করতে ব্যবহার করা যেতে পারে। এটি প্রশমিত করার একটি প্রয়াস হিসাবে, সফ্টওয়্যারটি জনসাধারণের ব্যক্তিত্ব এবং মানুষের মুখ সম্বলিত আপলোডের প্রম্পট প্রত্যাখ্যান করে৷ সম্ভাব্য আপত্তিকর বিষয়বস্তু সম্বলিত প্রম্পট ব্লক করা হয়, এবং আপলোড করা ছবিগুলি আপত্তিকর উপাদান শনাক্ত করার জন্য বিশ্লেষণ করা হয়। প্রম্পট-ভিত্তিক ফিল্টারিংয়ের একটি অসুবিধা হল যে বিকল্প বাক্যাংশগুলি ব্যবহার করে বাইপাস করা সহজ যার ফলে একই আউটপুট হয়। উদাহরণস্বরূপ, "রক্ত" শব্দটি ফিল্টার করা হয়, কিন্তু "কেচাপ" এবং "লাল তরল" নয়।
DALL·E 2 এবং অনুরূপ মডেলগুলি সম্পর্কে আরেকটি উদ্বেগ হল যে তারা তাদের যথার্থতা এবং জনপ্রিয়তার কারণে শিল্পী, ফটোগ্রাফার এবং গ্রাফিক ডিজাইনারদের জন্য প্রযুক্তিগত বেকারত্বের কারণ হতে পারে। DALL·E 3 ব্যবহারকারীদের বর্তমানে জীবিত শিল্পীদের শৈলীতে শিল্প তৈরি করতে বাধা দেওয়ার জন্য ডিজাইন করা হয়েছে।
অভ্যর্থনা
DALL·E-এর বেশির ভাগ কভারেজ "পরাবাস্তব" বা "অদ্ভুত" আউটপুটগুলির একটি ছোট উপসেটের উপর ফোকাস করে। DALL-E-এর আউটপুট "একটি কুকুরের হাঁটা টুটুতে একটি শিশুর ডাইকন মূলার একটি চিত্র" ইনপুট, এনবিসি, প্রকৃতি এবং অন্যান্য প্রকাশনা থেকে টুকরো টুকরো উল্লেখ করা হয়েছে। "একটি অ্যাভোকাডোর আকারে একটি আর্মচেয়ার" এর আউটপুটটিও ব্যাপকভাবে আচ্ছাদিত ছিল।
ExtremeTech বলেছে "আপনি DALL·E কে একটি নির্দিষ্ট সময় থেকে ফোন বা ভ্যাকুয়াম ক্লিনারের ছবি চাইতে পারেন, এবং এটি বুঝতে পারে কিভাবে সেই বস্তুগুলি পরিবর্তিত হয়েছে।" Engadget এছাড়াও "টেলিফোন এবং অন্যান্য বস্তুর পরিবর্তন কীভাবে হয় তা বোঝার জন্য এর অস্বাভাবিক ক্ষমতা উল্লেখ করেছে। সময়ের সাথে সাথে"
এমআইটি টেকনোলজি রিভিউ অনুসারে, ওপেনএআই-এর উদ্দেশ্যগুলির মধ্যে একটি ছিল "ভাষা মডেলগুলিকে দৈনন্দিন ধারণাগুলিকে আরও ভালভাবে উপলব্ধি করা যা মানুষ জিনিসগুলি বোঝাতে ব্যবহার করে"।
ওয়াল স্ট্রিট বিনিয়োগকারীরা DALL·E 2-এর ইতিবাচক অভ্যর্থনা পেয়েছে, কিছু সংস্থা মনে করে যে এটি ভবিষ্যতের বহু-ট্রিলিয়ন ডলার শিল্পের জন্য একটি টার্নিং পয়েন্ট উপস্থাপন করতে পারে। 2019 সালের মাঝামাঝি পর্যন্ত, OpenAI ইতিমধ্যেই Microsoft এবং Khosla Ventures থেকে $1 বিলিয়নের বেশি তহবিল পেয়েছে এবং 2023 সালের জানুয়ারিতে, DALL·E 2 এবং ChatGPT চালু হওয়ার পরে, Microsoft থেকে অতিরিক্ত $10 বিলিয়ন তহবিল পেয়েছে।
জাপানের অ্যানিমে সম্প্রদায় DALL·E 2 এবং অনুরূপ মডেলগুলির প্রতি নেতিবাচক প্রতিক্রিয়া দেখিয়েছে। সফ্টওয়্যারের বিরুদ্ধে শিল্পীরা সাধারণত দুটি যুক্তি উপস্থাপন করে। প্রথমটি হল এআই আর্ট শিল্প নয় কারণ এটি মানুষের দ্বারা অভিপ্রায়ে তৈরি হয়নি। "তাদের নিজস্ব কাজের সাথে এআই-উত্পাদিত চিত্রগুলির সংমিশ্রণ অবমাননাকর এবং তাদের শিল্পে যে সময় এবং দক্ষতা যায় তা হ্রাস করে৷ AI-চালিত চিত্র তৈরির সরঞ্জামগুলি শিল্পীদের দ্বারা প্রবলভাবে সমালোচিত হয়েছে কারণ তারা স্ক্র্যাপ করা মানবসৃষ্ট শিল্পের উপর প্রশিক্ষিত। ওয়েব।" দ্বিতীয়টি হল কপিরাইট আইনের সমস্যা, এবং ডেটা টেক্সট-টু-ইমেজ মডেলগুলিকে প্রশিক্ষণ দেওয়া হয়। ওপেনএআই DALL·E 2কে প্রশিক্ষণ দেওয়ার জন্য কোন ডেটাসেট(গুলি) ব্যবহার করা হয়েছিল সে সম্পর্কে তথ্য প্রকাশ করেনি, কিছু লোকের উদ্বেগকে উস্কে দেয় যে শিল্পীদের কাজ অনুমতি ছাড়াই প্রশিক্ষণের জন্য ব্যবহার করা হয়েছে। এই বিষয়গুলিকে ঘিরে কপিরাইট আইনগুলি এই মুহূর্তে অনিশ্চিত৷
DALL·E 3-কে Bing Chat এবং ChatGPT-এ একীভূত করার পর, মাইক্রোসফট এবং ওপেনএআই অত্যধিক বিষয়বস্তু ফিল্টারিংয়ের জন্য সমালোচনার সম্মুখীন হয়েছে, সমালোচকরা বলছেন যে DALL·E "লোবোটোমাইজড" হয়েছে। "মানুষ স্লেজহ্যামার দিয়ে সার্ভার র্যাক ভেঙে দেয়" এর মতো প্রম্পট দ্বারা উত্পন্ন চিত্রগুলির ফ্ল্যাগিংকে প্রমাণ হিসাবে উল্লেখ করা হয়েছিল। এটির প্রবর্তনের প্রথম দিনগুলিতে, ফিল্টারিং এমন জায়গায় বাড়ানো হয়েছিল যেখানে Bing-এর নিজস্ব প্রস্তাবিত প্রম্পটগুলির দ্বারা তৈরি করা ছবিগুলিকে ব্লক করা হয়েছিল৷ TechRadar যুক্তি দিয়েছিল যে সতর্কতার দিকে খুব বেশি ঝুঁকে পড়া একটি সৃজনশীল হাতিয়ার হিসাবে DALL·E এর মানকে সীমিত করতে পারে।
ওপেন সোর্স বাস্তবায়ন
যেহেতু OpenAI তিনটি মডেলের কোনোটির জন্য সোর্স কোড প্রকাশ করেনি, তাই DALL·E-এর ওপেন-সোর্স ইমপ্লিমেন্টেশন তৈরি করার জন্য বেশ কিছু প্রচেষ্টা করা হয়েছে। 2022 সালে Hugging Face's Spaces প্ল্যাটফর্মে প্রকাশ করা হয়, Craiyon (পূর্বে DALL·E Mini ছিল যতক্ষণ না পর্যন্ত OpenAI দ্বারা 2022 সালের জুনে নাম পরিবর্তনের অনুরোধ করা হয়েছিল) হল একটি AI মডেল যা মূল DALL·E-এর উপর ভিত্তি করে যা ইন্টারনেট থেকে আনফিল্টার করা ডেটার উপর প্রশিক্ষিত হয়েছিল। 2022-এর মাঝামাঝি সময়ে এটি রসাত্মক চিত্র তৈরির ক্ষমতার কারণে প্রকাশের পর মিডিয়ার যথেষ্ট মনোযোগ আকর্ষণ করেছিল।
আরো দেখুন
কৃত্রিম বুদ্ধিমত্তা শিল্প
ডিপ ড্রিম
চিত্র (গুগল ব্রেইন)
মিডজার্নি
স্থিতিশীল বিস্তার
প্রম্পট ইঞ্জিনিয়ারিং