سه قسمت اول دربارهٔ متن بودند: انتخاب ابزار، پرسیدنِ درست، و اعتماد کردن یا نکردن به جواب. حالا همان مهارت را میبریم سراغ تصویر — و میبینی که قاعدهها عوض نمیشوند، فقط واژگانشان فرق میکند.
و یک نکته که نصف خوانندگان این درس نمیدانند: خواندنِ تصویر توسط هوش مصنوعی، بیشتر از ساختنش به درد کار روزمره میخورد.
در قسمت دوم دیدیم که مدل ذهنت را نمیخواند. برای تصویر، این مسئله دو برابر میشود — چون یک تصویر دهها تصمیم دارد و تو معمولاً فقط یکیشان را مینویسی.
بنویسی «یک زن در حال قدمزدن»، مدل باید خودش تصمیم بگیرد: کجا؟ چه ساعتی از روز؟ از چه فاصلهای میبینیمش؟ دوربین کجاست؟ رنگها گرماند یا سرد؟ نقاشی است یا عکس؟ هر کدام از اینها را ننویسی، یکی از هزاران حالتِ ممکن را میگیری — و بعد فکر میکنی مدل ضعیف است.
در متن، زمینه مهمترین تکه بود. در تصویر، هر چیزی که ننویسی، تصادفی انتخاب میشود. این همان قاعده است با لباس دیگر.
در قسمت دوم شش تکه برای متن داشتیم. برای تصویر پنج تکه است، و ترتیبشان هم مهم است — مدل به اولِ جمله بیشتر وزن میدهد.
| تکه | چه چیزی را تعیین میکند |
|---|---|
| ۱. سوژهSubject | چه چیزی در قاب است، و چند تا. هرچه مشخصتر بهتر: «یک زن مسن با روسری آبی» نه «یک نفر». |
| ۲. کنش و حالتAction | دارد چه میکند و در چه حالی است. بدون این، تصویرت یک عکس پرسنلی میشود. |
| ۳. مکان و زمانSetting | کجا و چه ساعتی. «بازار قدیمی، ساعتی پیش از غروب» یک فضا میسازد؛ «بیرون» هیچ نمیسازد. |
| ۴. نورLight | مهمترین تکهای که مبتدیها مینویسندش. نور است که تصویر را از «رندر» به «عکس» تبدیل میکند: نور پهلویی، نور پشتی، ساعت طلایی، سایهی سخت. |
| ۵. قاب و سبکFraming & style | از چه فاصلهای، با چه لنزی، و به چه زبانی: عکس، نقاشی رنگروغن، مینیاتور. اینجا جایی است که کتابخانهی پرامپت کارَت را تمام میکند. |
تکهی پنجم را لازم نیست خودت از صفر بنویسی. کتابخانهی پرامپت فارسی بیستوهفت سبک آماده دارد — از مینیاتور ایرانی و قاجار تا عکاسی مستند و کیاروسکورو — و هر کدام پرامپت انگلیسیِ آماده، پرامپت منفی و توضیح فارسی دارند. سه تکهی اول را خودت بنویس، سبک را از آنجا بردار.
مثل قسمت قبل، خودت پرش کن. متن انگلیسی پایین همان لحظه ساخته میشود — انگلیسی، چون مدلهای تصویر با انگلیسی بهمراتب بهتر کار میکنند.
آن خط آخر، پرامپت منفی است: فهرست چیزهایی که نمیخواهی. خیلی از ابزارها کادر جداگانهای برایش دارند؛ اگر نداشت، همانجا در انتهای پرامپت بگذارش. برای هر سبک، فهرست مخصوص خودش در کتابخانه هست.
این نیمهی فراموششده است. بیشتر مردم فقط تصویر میسازند، در حالی که خواندنِ تصویر همان چیزی است که در کار روزمره وقت آزاد میکند.
هر سه ابزاری که در قسمت اول معرفی کردم عکس میخوانند. چند کارِ واقعی که همین امروز میتوانی بکنی:
| عکس از | و بپرس |
|---|---|
| تختهی کلاس یا اسلاید | «این را به یادداشت مرتب تبدیل کن و هر جا که ناخواناست بگو مطمئن نیستی.» |
| یک نمودار یا جدول | «این نمودار چه میگوید؟ سه نکتهای که در نگاه اول دیده نمیشود چیست؟» |
| یک فرم یا قبض | «اطلاعاتش را در یک جدول مرتب کن.» — بهجای تایپکردن دستی. |
| یک اسکرینشات از خطا | «این خطا چه میگوید و از کجا میآید؟» |
| کار خودت | «اگر داورِ سختگیری بودی، سه ایراد این طراحی را چه میگفتی؟» |
همان قاعدهی قسمت دوم اینجا هم برقرار است: عکس را بده و بگو دقیقاً چه میخواهی. «این چیه؟» جواب کلی میگیرد؛ «متن این تخته را به فهرست تبدیل کن» جواب قابلاستفاده.
عکسی که آپلود میکنی از دستت خارج میشود. عکس مدرک شناسایی، فیش حقوقی، پروندهی بیمار و صفحهی حساب بانکی را آپلود نکن — نه به این ابزار، نه به هیچ سرویس آنلاین دیگری. اگر لازم است، اول قسمتهای حساس را بپوشان.
این لحظهای است که بیشترِ آدمها بیخیال میشوند: خروجی بد نیست، ولی آن چیزی هم که میخواستی نیست. کاری که اکثراً میکنند این است که کلِ پرامپت را از نو مینویسند — و همانجا هر چیزی که درست بود را هم از دست میدهند.
اگر همان پرامپت را دو بار بزنی، دو تصویرِ متفاوت میگیری. این خرابی نیست؛ طرزِ کارِ این ابزار است — هر بار از یک نقطهی تصادفیِ دیگر شروع میکند. پس:
نتیجهی عملیاش ساده است: هر چیزی که برایت مهم است را بگو. اگر چیزی را دو بار پشت سر هم غلط داد، احتمالاً اصلاً نگفتهایاش.
این همان حلقهای است که در قسمت دوم برای متن دیدی، با همان قاعده: یک متغیر در هر بار. اگر همزمان نور و لنز و سبک را عوض کنی و نتیجه بهتر شود، نمیدانی کدامش کار کرد — و دفعهی بعد نمیتوانی تکرارش کنی.
پرامپتی که تقریباً جواب داده را دور نریز. کپیاش کن، یک تکهاش را عوض کن، دوباره بزن. سه بارِ این کار، تقریباً همیشه از یک بارِ نوشتنِ دوباره بهتر جواب میدهد — و در ضمن یاد میگیری کدام تکه چه کاری میکند.
گاهی راهحل، اضافهکردن نیست — کمکردن است. اگر تصویری مدام یک چیزِ ناخواسته میآورد، صریح بگو نباشد: «بدون متن»، «بدون واترمارک»، «بدون آدم در پسزمینه». بعضی ابزارها برای این کار جای جداگانه دارند و در بقیه همانجا در پرامپت مینویسیاش.
یک چیز را از همین حالا بدان تا وقت تلف نکنی: متنِ فارسی روی تصویر، هنوز درست در نمیآید. حروف شبیهِ فارسی میشوند ولی کلمه نیستند. اگر پوستر یا کاور میخواهی، تصویرش را با هوش مصنوعی بساز و متن را بعداً خودت رویش بگذار — با هر ابزار سادهی طراحی. این یک محدودیت است، نه اشتباهِ پرامپتِ تو.
در قسمت اول یاد گرفتی چه چیزی را داخل چت نکنی. تصویر یک مرزِ دیگر هم دارد که سختتر است، چون به چهرهی آدمهای واقعی مربوط میشود — و چهره، برخلاف یک فایل، پس گرفته نمیشود.
| نکن | چرا |
|---|---|
| چهرهی آدمِ واقعی را در صحنهای که نبوده نگذار | حتی به شوخی. این کار در بسیاری از کشورها جرم است و در همهجا خیانت به اعتماد است. چهرهی خودت هم استثنا نیست وقتی پای دیگران وسط باشد. |
| تصویر پزشکی را به مدل نسپار | برای فهمیدنِ یک مفهوم بپرس، ولی هیچ تصویر پزشکیِ واقعیِ کسی را برای تشخیص نده. |
| خروجی را بدون گفتن منتشر نکن | اگر تصویری با هوش مصنوعی ساختهای و ممکن است کسی واقعی فرضش کند، بگو. این یک خط است که اعتبار چندساله را حفظ میکند. |
یک قاعدهی ساده که همهی اینها را پوشش میدهد: اگر آدمی که در تصویر است میدید چه کردهای و ناراحت میشد، نکن. همین قاعده در قسمت بعد برای صدا هم تکرار میشود، چون آنجا حتی راحتتر زیر پا میرود.
هفت کار. تیکها روی همین مرورگر میمانند.
تا اینجا هر چهار قسمت دربارهٔ چیزی بود که میبینی — متن روی صفحه، تصویر در قاب. قسمت پنجم دربارهٔ چیزی است که میشنوی، و کماستفادهترین و شاید پرارزشترین بخشِ کل این دوره است.
تا آن موقع تمرین این هفته را انجام بده.
قابلیتهای تصویر سریعتر از هر بخش دیگری عوض میشوند. فقط از مستندات رسمی بخوان:
تاریخ نگارش: مرداد ۱۴۰۵. قاعدههای این درس کهنه نمیشوند؛ نام قابلیتها ممکن است عوض شود.