نانو بنانا پرو: راهنمای کامل فارسی

نانو بنانا پرو همان Gemini 3 Pro Image است. در این راهنما می‌بینیم چه کارهایی می‌کند که بقیه نمی‌کنند — از نوشتن متن داخل تصویر و ۱۴ تصویر مرجع تا ویرایش گفت‌وگویی — و محدودیت‌های واقعی‌اش کجاست.

نانو بنانا پرو نام غیررسمی و همه‌گیرِ Gemini 3 Pro Image است؛ مدل تصویرسازی گوگل که در حال حاضر یکی از دقیق‌ترین گزینه‌ها برای کارهای حرفه‌ای است. اسم بامزه‌اش از دورهٔ آزمایشی مدل روی پلتفرم‌های مقایسه باقی مانده و آن‌قدر گرفت که خود گوگل هم عملاً پذیرفتش.

این راهنما توضیح می‌دهد نانو بنانا پرو دقیقاً چه کارهایی می‌کند که بقیهٔ مدل‌ها نمی‌کنند، محدودیت‌های واقعی‌اش کجاست، و چطور پرامپتی بنویسید که از قابلیت‌های خاصش استفاده کند. اگر هنوز اصول کلی پرامپت‌نویسی را مرور نکرده‌اید، بهتر است اول راهنمای پرامپت‌نویسی تصویر را بخوانید؛ اینجا فقط روی چیزهایی تمرکز می‌کنیم که مخصوص این مدل است.

چه چیزی نانو بنانا پرو را متفاوت می‌کند؟

۱. موتور استدلال، نه فقط تطبیق الگو

مدل‌های نسل قبل عملاً کلمات پرامپت را به الگوهای بصری نگاشت می‌کردند. نانو بنانا پرو روی Gemini 3 Pro سوار است، یعنی قبل از تولید تصویر، درخواست را «می‌فهمد». نتیجهٔ عملی این است که به دستورهای منطقی و شرطی جواب می‌دهد — چیزی که در مدل‌های قبلی بی‌معنا بود:

«یک اینفوگرافیک از چرخهٔ آب بساز و مطمئن شو ترتیب مراحل از راست به چپ درست باشد.»

همین توانایی باعث شده سبکی از پرامپت‌نویسی روی این مدل رواج پیدا کند که در آن پرامپت را مثل کد یا ساختار داده می‌نویسند. در راهنمای پرامپت JSON مفصل به آن پرداخته‌ایم.

۲. متن داخل تصویر، در سطحی متفاوت

بزرگ‌ترین برتری عملی این مدل، نوشتن متن است. مدل‌های دیگر معمولاً حروف را به‌هم می‌ریزند؛ نانو بنانا پرو می‌تواند یک پوستر با سه بلوک متنی مجزا و فونت‌های متفاوت بسازد. برای گرفتن بهترین نتیجه:

  • متن را داخل گیومه بگذارید تا مدل بداند دقیقاً همین حروف باید بیاید
  • برای هر بلوک، سبک فونت را جدا توصیف کنید: «با فونت اسکریپت روان» یا «با سن‌سریف ضخیم و بلوکی»
  • جای هر بلوک را مشخص کنید: «خط بالا»، «زیر محصول»

واقعیت فارسی: پشتیبانی از فارسی به‌مراتب ضعیف‌تر از انگلیسی است. اتصال حروف و شکل نهایی کلمات اغلب خراب می‌شود، مخصوصاً در جمله‌های بلند. برای کار حرفه‌ای، تصویر را با فضای خالی برای متن تولید کنید و تایپوگرافی فارسی را بیرون از مدل اضافه کنید.

۳. تا ۱۴ تصویر مرجع هم‌زمان

می‌توانید تا ۱۴ تصویر مرجع بدهید و بگویید هرکدام چه نقشی دارد. این برای سه کار خیلی خوب جواب می‌دهد:

  • حفظ هویت چند نفر در یک صحنه (عکس گروهی یا زوج)
  • قراردادن یک محصول واقعی در صحنه‌ای جدید، بدون تغییر شکل و برچسبش
  • ترکیب ساختار و بافت: «از اسکچ پیوست به‌عنوان فرم و از نمونه‌پارچه به‌عنوان بافت استفاده کن»

۴. جست‌وجوی زنده

مدل به جست‌وجوی وب دسترسی دارد و می‌تواند داده‌ای را بگیرد و تصویری بسازد. مثلاً «آب‌وهوای فعلی تهران را ببین و صحنه را مطابق آن بساز». نکتهٔ مهم برای واقع‌نمایی: دانش داخلی مدل تا ژانویهٔ ۲۰۲۵ است؛ هر چیز جدیدتر از آن فقط از راه جست‌وجو می‌آید.

۵. ویرایش گفت‌وگویی

لازم نیست هر بار از صفر شروع کنید. اگر تصویر ۸۰ درصد درست است، همان را نگه دارید و فقط تفاوت را بخواهید. این کار هم سریع‌تر است، هم آن ۸۰ درصدی را که دوست داشتید حفظ می‌کند.

مشخصات فنی

مورد مقدار
نام رسمی Gemini 3 Pro Image
رزولوشن خروجی ۱K، ۲K، ۴K
نسبت‌های تصویر ۱:۱، ۳:۲، ۲:۳، ۳:۴، ۴:۳، ۴:۵، ۵:۴، ۹:۱۶، ۱۶:۹، ۲۱:۹
حداکثر تصویر مرجع ۱۴
پنجرهٔ ورودی ۶۵٬۵۳۶ توکن
فرمت‌های ورودی PNG، JPEG، WebP، HEIC، HEIF — و متن و PDF
تاریخ دانش ژانویهٔ ۲۰۲۵
نشانه‌گذاری خروجی واترمارک نامرئی SynthID و اطلاعات اصالت C2PA

ساختار پرامپت برای این مدل

گوگل خودش دو الگو را توصیه می‌کند. اولی برای تولید از صفر:

[سوژه] + [کنش] + [محیط] + [ترکیب‌بندی] + [سبک]

و دومی وقتی تصویر مرجع دارید — که ساختار متفاوتی می‌خواهد:

[تصاویر مرجع] + [نقش هرکدام] + [صحنهٔ جدید]

تفاوت مهم در الگوی دوم این است که باید رابطهٔ تصاویر مرجع را توضیح دهید، نه فقط آن‌ها را پیوست کنید. «از این به‌عنوان چهره و از آن به‌عنوان لباس استفاده کن» خیلی بهتر از پیوست‌کردن ساکت دو عکس جواب می‌دهد.

یک نمونهٔ کامل

از تصویر مرجع آپلودشده به‌عنوان تنها مرجع هویت استفاده کن؛
ساختار چهره، سن، رنگ پوست و حالت طبیعی را دقیقاً حفظ کن
و زیباسازی نکن.

[سوژه] مردی سی‌ساله با ژاکت جیر بژ و تی‌شرت سفید.
[کنش] به دیوار سنگی بافت‌دار تکیه داده، یک دست در جیب،
       نگاه رو به بیرون از کادر.
[محیط] کوچه‌ای آفتاب‌خورده در ساعت طلایی.
[ترکیب‌بندی] نمای متوسط، سوژه در یک‌سوم راست، عمودی ۴:۵.
[نور] نور گرم کم‌ارتفاع از سمت چپ، سایه‌های تیز روی دیوار.
[دوربین] لنز ۳۵ میلی‌متری، f/1.8، عمق میدان کم.
[سبک] تن‌های خاکی کدر، دانهٔ ظریف فیلم.

حفظ یکدستی شخصیت در چند تصویر

سخت‌ترین کار در تصویرسازی هوش مصنوعی این است که یک شخصیت در چند تصویر مختلف همان شخصیت بماند. موثرترین روش شناخته‌شده، ساختن یک «شیت شخصیت» است: در یک تولید، چند نمای مختلف از همان شخصیت را در یک قاب بخواهید — نمای روبه‌رو، نیم‌رخ، سه‌رخ. بعد از همان تصویر به‌عنوان مرجع برای تولیدهای بعدی استفاده کنید.

روش دوم که در گالری زیاد دیده می‌شود، خواستن یک شبکهٔ چندپنلی در همان تولید است — مثلاً یک شبکهٔ ۳ در ۳ با نُه ژست مختلف و نور یکسان. چون همه در یک بار تولید می‌شوند، یکدستی به‌مراتب بهتر است.

وقتی نانو بنانا پرو انتخاب درستی نیست

هیچ مدلی برای همه‌چیز بهترین نیست. مواردی که بهتر است سراغ گزینهٔ دیگری بروید:

  • متن فارسی داخل تصویر: هیچ مدلی هنوز قابل اتکا نیست — کار را بیرون از مدل انجام دهید
  • سبک‌های تصویرسازی بسیار خاص هنری: مدل‌هایی مثل میدجرنی هنوز در حس هنری و اتمسفر دست بالا را دارند
  • تولید انبوه و ارزان: برای صدها تصویر ساده، مدل‌های سبک‌تر مقرون‌به‌صرفه‌ترند
  • محتوای حساس: فیلترهای ایمنی گوگل سخت‌گیرند و خیلی از درخواست‌ها رد می‌شوند

هشت اشتباه رایج مخصوص این مدل

  1. کپی‌کردن پرامپت‌های قدیمی: بندهایی مثل «masterpiece, award winning, trending on artstation» برای مدل‌های نسل قبل بود و اینجا فقط پرامپت را شلوغ می‌کند
  2. پیوست‌کردن تصاویر مرجع بدون توضیح نقششان
  3. نگفتن «زیباسازی نکن» که باعث می‌شود چهره صاف و بی‌شباهت شود
  4. بیان منفی: «بدون ماشین» احتمال ظاهرشدن ماشین را بیشتر می‌کند؛ بنویسید «خیابان خالی»
  5. بازنویسی کامل به‌جای استفاده از ویرایش گفت‌وگویی
  6. ننوشتن نسبت تصویر
  7. انتظار دانش به‌روز بدون فعال‌کردن جست‌وجو
  8. دستورهای متناقض در یک پرامپت — مدل یکی را انتخاب می‌کند و معمولاً آن یکی نیست که شما می‌خواستید

پرامپت‌های آمادهٔ نانو بنانا پرو

در گالری پینک‌پیکس حدود ۱۹۰ پرامپت فارسی مخصوص نانو بنانا پرو با تصویر خروجی منتشر شده — متن کامل هر پرامپت روی صفحه‌اش هست و می‌توانید کپی کنید و تغییر دهید. دسته‌های پرکاربرد:

پرسش‌های پرتکرار

نانو بنانا با نانو بنانا پرو چه فرقی دارد؟

نسخهٔ پرو روی مدل بزرگ‌تر Gemini 3 Pro سوار است و در استدلال، متن داخل تصویر و جزئیات دقیق‌تر است. نسخهٔ معمولی سریع‌تر و ارزان‌تر است و برای کارهای ساده کافی. برای پوستر، تایپوگرافی و صحنه‌های چندعنصری، تفاوت محسوس است.

آیا فارسی را می‌فهمد؟

بله، توصیف صحنه به فارسی را خوب می‌فهمد. اما اصطلاح‌های فنی عکاسی را انگلیسی بنویسید و برای نوشتن متن داخل تصویر به فارسی حساب باز نکنید — این دو موضوع کاملاً جدا هستند.

چرا خروجی من ۴K نیست؟

رزولوشن باید صراحتاً در تنظیمات یا پرامپت مشخص شود، وگرنه خروجی پیش‌فرض ۱K است. برای وب ۱K کافی است؛ برای چاپ یا کراپ بعدی، ۲K به بالا بگیرید.

واترمارک SynthID یعنی چه؟

یک نشانهٔ نامرئی در پیکسل‌های تصویر که قابل حذف با کراپ یا فشرده‌سازی نیست و مشخص می‌کند تصویر ساختهٔ هوش مصنوعی است. علاوه بر آن، اطلاعات اصالت C2PA هم در فایل ذخیره می‌شود. برای کارهای تبلیغاتی و رسانه‌ای این را در نظر داشته باشید.

چند تصویر مرجع بدهم بهتر است؟

تا ۱۴ تصویر ممکن است، اما بیشتر همیشه بهتر نیست. برای حفظ چهره، دو تا سه عکس واضح از زوایای مختلف معمولاً بهترین نتیجه را می‌دهد. مهم‌تر از تعداد، این است که نقش هر تصویر را در پرامپت توضیح دهید.


برای مرور اصول پایه‌ای که در همهٔ مدل‌ها مشترک است، به راهنمای کامل پرامپت‌نویسی تصویر برگردید. و اگر می‌خواهید پرامپت‌هایتان تکرارپذیر و قابل استفادهٔ مجدد شوند، راهنمای پرامپت JSON قدم بعدی است.

پرامپت کپی شد