NAVIDIX همه‌ی آموزش‌ها ←
دوره‌ی مقدماتی · قسمت چهارم

تصویر: ساختن و خواندن

سه قسمت اول دربارهٔ متن بودند: انتخاب ابزار، پرسیدنِ درست، و اعتماد کردن یا نکردن به جواب. حالا همان مهارت را می‌بریم سراغ تصویر — و می‌بینی که قاعده‌ها عوض نمی‌شوند، فقط واژگانشان فرق می‌کند.

و یک نکته که نصف خوانندگان این درس نمی‌دانند: خواندنِ تصویر توسط هوش مصنوعی، بیشتر از ساختنش به درد کار روزمره می‌خورد.

گوشه‌ی یک استودیوی تاریک: یک سافت‌باکس بزرگ روی چهارپایه‌ای خالی، و میکروفون کندانسر روی بوم
۵تکه‌ی یک پرامپت تصویر
۲جهت: ساختن و خواندن
۲۷سبک آماده در کتابخانه
لایه ۰۱

چرا تصویرهایت شبیه چیزی که در ذهنت بود نیستند

در قسمت دوم دیدیم که مدل ذهنت را نمی‌خواند. برای تصویر، این مسئله دو برابر می‌شود — چون یک تصویر ده‌ها تصمیم دارد و تو معمولاً فقط یکی‌شان را می‌نویسی.

بنویسی «یک زن در حال قدم‌زدن»، مدل باید خودش تصمیم بگیرد: کجا؟ چه ساعتی از روز؟ از چه فاصله‌ای می‌بینیمش؟ دوربین کجاست؟ رنگ‌ها گرم‌اند یا سرد؟ نقاشی است یا عکس؟ هر کدام از این‌ها را ننویسی، یکی از هزاران حالتِ ممکن را می‌گیری — و بعد فکر می‌کنی مدل ضعیف است.

قاعده

در متن، زمینه مهم‌ترین تکه بود. در تصویر، هر چیزی که ننویسی، تصادفی انتخاب می‌شود. این همان قاعده است با لباس دیگر.


پنج تکه‌ی یک پرامپت تصویر

در قسمت دوم شش تکه برای متن داشتیم. برای تصویر پنج تکه است، و ترتیبشان هم مهم است — مدل به اولِ جمله بیشتر وزن می‌دهد.

تکهچه چیزی را تعیین می‌کند
۱. سوژهSubject چه چیزی در قاب است، و چند تا. هرچه مشخص‌تر بهتر: «یک زن مسن با روسری آبی» نه «یک نفر».
۲. کنش و حالتAction دارد چه می‌کند و در چه حالی است. بدون این، تصویرت یک عکس پرسنلی می‌شود.
۳. مکان و زمانSetting کجا و چه ساعتی. «بازار قدیمی، ساعتی پیش از غروب» یک فضا می‌سازد؛ «بیرون» هیچ نمی‌سازد.
۴. نورLight مهم‌ترین تکه‌ای که مبتدی‌ها می‌نویسندش. نور است که تصویر را از «رندر» به «عکس» تبدیل می‌کند: نور پهلویی، نور پشتی، ساعت طلایی، سایه‌ی سخت.
۵. قاب و سبکFraming & style از چه فاصله‌ای، با چه لنزی، و به چه زبانی: عکس، نقاشی رنگ‌روغن، مینیاتور. اینجا جایی است که کتابخانه‌ی پرامپت کارَت را تمام می‌کند.
پیوند

تکه‌ی پنجم را لازم نیست خودت از صفر بنویسی. کتابخانه‌ی پرامپت فارسی بیست‌وهفت سبک آماده دارد — از مینیاتور ایرانی و قاجار تا عکاسی مستند و کیاروسکورو — و هر کدام پرامپت انگلیسیِ آماده، پرامپت منفی و توضیح فارسی دارند. سه تکه‌ی اول را خودت بنویس، سبک را از آنجا بردار.

لایه ۰۲

تصویرساز

مثل قسمت قبل، خودت پرش کن. متن انگلیسی پایین همان لحظه ساخته می‌شود — انگلیسی، چون مدل‌های تصویر با انگلیسی به‌مراتب بهتر کار می‌کنند.


      
    

آن خط آخر، پرامپت منفی است: فهرست چیزهایی که نمی‌خواهی. خیلی از ابزارها کادر جداگانه‌ای برایش دارند؛ اگر نداشت، همان‌جا در انتهای پرامپت بگذارش. برای هر سبک، فهرست مخصوص خودش در کتابخانه هست.

لایه ۰۳

جهت دیگر: عکس بده، جواب بگیر

این نیمه‌ی فراموش‌شده است. بیشتر مردم فقط تصویر می‌سازند، در حالی که خواندنِ تصویر همان چیزی است که در کار روزمره وقت آزاد می‌کند.

هر سه ابزاری که در قسمت اول معرفی کردم عکس می‌خوانند. چند کارِ واقعی که همین امروز می‌توانی بکنی:

عکس ازو بپرس
تخته‌ی کلاس یا اسلاید «این را به یادداشت مرتب تبدیل کن و هر جا که ناخواناست بگو مطمئن نیستی.»
یک نمودار یا جدول «این نمودار چه می‌گوید؟ سه نکته‌ای که در نگاه اول دیده نمی‌شود چیست؟»
یک فرم یا قبض «اطلاعاتش را در یک جدول مرتب کن.» — به‌جای تایپ‌کردن دستی.
یک اسکرین‌شات از خطا «این خطا چه می‌گوید و از کجا می‌آید؟»
کار خودت «اگر داورِ سختگیری بودی، سه ایراد این طراحی را چه می‌گفتی؟»

همان قاعده‌ی قسمت دوم اینجا هم برقرار است: عکس را بده و بگو دقیقاً چه می‌خواهی. «این چیه؟» جواب کلی می‌گیرد؛ «متن این تخته را به فهرست تبدیل کن» جواب قابل‌استفاده.

حواست باشد

عکسی که آپلود می‌کنی از دستت خارج می‌شود. عکس مدرک شناسایی، فیش حقوقی، پرونده‌ی بیمار و صفحه‌ی حساب بانکی را آپلود نکن — نه به این ابزار، نه به هیچ سرویس آنلاین دیگری. اگر لازم است، اول قسمت‌های حساس را بپوشان.

لایه ۰۴

وقتی نزدیک شد ولی درست نشد

این لحظه‌ای است که بیشترِ آدم‌ها بی‌خیال می‌شوند: خروجی بد نیست، ولی آن چیزی هم که می‌خواستی نیست. کاری که اکثراً می‌کنند این است که کلِ پرامپت را از نو می‌نویسند — و همان‌جا هر چیزی که درست بود را هم از دست می‌دهند.

اول بدان چه چیزی اصلاً در کنترلت نیست

اگر همان پرامپت را دو بار بزنی، دو تصویرِ متفاوت می‌گیری. این خرابی نیست؛ طرزِ کارِ این ابزار است — هر بار از یک نقطه‌ی تصادفیِ دیگر شروع می‌کند. پس:

  • چیزی که کنترل می‌کنی: سوژه، قاب، نور، سبک، حال‌وهوا — هر چیزی که گفته‌ای.
  • چیزی که کنترل نمی‌کنی: جزئیاتی که نگفته‌ای. اگر نگفته باشی پیراهن چه رنگی است، هر بار رنگِ دیگری می‌آید — و این تقصیر مدل نیست.

نتیجه‌ی عملی‌اش ساده است: هر چیزی که برایت مهم است را بگو. اگر چیزی را دو بار پشت سر هم غلط داد، احتمالاً اصلاً نگفته‌ای‌اش.

بعد، یک چیز را عوض کن — نه همه را

این همان حلقه‌ای است که در قسمت دوم برای متن دیدی، با همان قاعده: یک متغیر در هر بار. اگر همزمان نور و لنز و سبک را عوض کنی و نتیجه بهتر شود، نمی‌دانی کدامش کار کرد — و دفعه‌ی بعد نمی‌توانی تکرارش کنی.

قاعده

پرامپتی که تقریباً جواب داده را دور نریز. کپی‌اش کن، یک تکه‌اش را عوض کن، دوباره بزن. سه بارِ این کار، تقریباً همیشه از یک بارِ نوشتنِ دوباره بهتر جواب می‌دهد — و در ضمن یاد می‌گیری کدام تکه چه کاری می‌کند.

و بگو چه چیزی را نمی‌خواهی

گاهی راه‌حل، اضافه‌کردن نیست — کم‌کردن است. اگر تصویری مدام یک چیزِ ناخواسته می‌آورد، صریح بگو نباشد: «بدون متن»، «بدون واترمارک»، «بدون آدم در پس‌زمینه». بعضی ابزارها برای این کار جای جداگانه دارند و در بقیه همان‌جا در پرامپت می‌نویسی‌اش.

انتظارِ واقع‌بینانه

یک چیز را از همین حالا بدان تا وقت تلف نکنی: متنِ فارسی روی تصویر، هنوز درست در نمی‌آید. حروف شبیهِ فارسی می‌شوند ولی کلمه نیستند. اگر پوستر یا کاور می‌خواهی، تصویرش را با هوش مصنوعی بساز و متن را بعداً خودت رویش بگذار — با هر ابزار ساده‌ی طراحی. این یک محدودیت است، نه اشتباهِ پرامپتِ تو.

لایه ۰۵

مرزهای تصویر — این بار جدی‌تر

در قسمت اول یاد گرفتی چه چیزی را داخل چت نکنی. تصویر یک مرزِ دیگر هم دارد که سخت‌تر است، چون به چهره‌ی آدم‌های واقعی مربوط می‌شود — و چهره، برخلاف یک فایل، پس گرفته نمی‌شود.

نکنچرا
چهره‌ی آدمِ واقعی را در صحنه‌ای که نبوده نگذار حتی به شوخی. این کار در بسیاری از کشورها جرم است و در همه‌جا خیانت به اعتماد است. چهره‌ی خودت هم استثنا نیست وقتی پای دیگران وسط باشد.
تصویر پزشکی را به مدل نسپار برای فهمیدنِ یک مفهوم بپرس، ولی هیچ تصویر پزشکیِ واقعیِ کسی را برای تشخیص نده.
خروجی را بدون گفتن منتشر نکن اگر تصویری با هوش مصنوعی ساخته‌ای و ممکن است کسی واقعی فرضش کند، بگو. این یک خط است که اعتبار چندساله را حفظ می‌کند.

یک قاعده‌ی ساده که همه‌ی این‌ها را پوشش می‌دهد: اگر آدمی که در تصویر است می‌دید چه کرده‌ای و ناراحت می‌شد، نکن. همین قاعده در قسمت بعد برای صدا هم تکرار می‌شود، چون آنجا حتی راحت‌تر زیر پا می‌رود.

تمرین این هفته

۰ از ۷

هفت کار. تیک‌ها روی همین مرورگر می‌مانند.

بعد

در قسمت پنجم

تا اینجا هر چهار قسمت دربارهٔ چیزی بود که می‌بینی — متن روی صفحه، تصویر در قاب. قسمت پنجم دربارهٔ چیزی است که می‌شنوی، و کم‌استفاده‌ترین و شاید پرارزش‌ترین بخشِ کل این دوره است.

  • پیاده‌سازی، و بعد استخراج — چرا فقط متن‌کردنِ یک جلسه تقریباً بی‌فایده است.
  • جلسه، کلاس، مصاحبه — سه کارِ واقعی با پرامپتِ آماده‌ی هرکدام.
  • زیرنویس و ترجمه — یک کارِ چندساعته که به چند دقیقه می‌رسد.
  • صدای مصنوعی — کجا به کارت می‌آید، و آن یک مرزی که هرگز نباید رد شود.

تا آن موقع تمرین این هفته را انجام بده.

برای راستی‌آزمایی خودت

قابلیت‌های تصویر سریع‌تر از هر بخش دیگری عوض می‌شوند. فقط از مستندات رسمی بخوان:

  • راهنمای تصویر و بینایی در مستندات OpenAI، Anthropic و Google — هر سه بخش vision جداگانه دارند.
  • سبک‌ها و پرامپت‌های آماده: کتابخانه‌ی پرامپت فارسی در همین سایت.

تاریخ نگارش: مرداد ۱۴۰۵. قاعده‌های این درس کهنه نمی‌شوند؛ نام قابلیت‌ها ممکن است عوض شود.

نوشته و تدریس: محمد نویدی — متخصص هوش مصنوعی کاربردی · استودیو نویدیکس
NavidixNAVIDIX