نانو بنانا پرو: راهنمای کامل فارسی
نانو بنانا پرو همان Gemini 3 Pro Image است. در این راهنما میبینیم چه کارهایی میکند که بقیه نمیکنند — از نوشتن متن داخل تصویر و ۱۴ تصویر مرجع تا ویرایش گفتوگویی — و محدودیتهای واقعیاش کجاست.
نانو بنانا پرو نام غیررسمی و همهگیرِ Gemini 3 Pro Image است؛ مدل تصویرسازی گوگل که در حال حاضر یکی از دقیقترین گزینهها برای کارهای حرفهای است. اسم بامزهاش از دورهٔ آزمایشی مدل روی پلتفرمهای مقایسه باقی مانده و آنقدر گرفت که خود گوگل هم عملاً پذیرفتش.
این راهنما توضیح میدهد نانو بنانا پرو دقیقاً چه کارهایی میکند که بقیهٔ مدلها نمیکنند، محدودیتهای واقعیاش کجاست، و چطور پرامپتی بنویسید که از قابلیتهای خاصش استفاده کند. اگر هنوز اصول کلی پرامپتنویسی را مرور نکردهاید، بهتر است اول راهنمای پرامپتنویسی تصویر را بخوانید؛ اینجا فقط روی چیزهایی تمرکز میکنیم که مخصوص این مدل است.
چه چیزی نانو بنانا پرو را متفاوت میکند؟
۱. موتور استدلال، نه فقط تطبیق الگو
مدلهای نسل قبل عملاً کلمات پرامپت را به الگوهای بصری نگاشت میکردند. نانو بنانا پرو روی Gemini 3 Pro سوار است، یعنی قبل از تولید تصویر، درخواست را «میفهمد». نتیجهٔ عملی این است که به دستورهای منطقی و شرطی جواب میدهد — چیزی که در مدلهای قبلی بیمعنا بود:
«یک اینفوگرافیک از چرخهٔ آب بساز و مطمئن شو ترتیب مراحل از راست به چپ درست باشد.»
همین توانایی باعث شده سبکی از پرامپتنویسی روی این مدل رواج پیدا کند که در آن پرامپت را مثل کد یا ساختار داده مینویسند. در راهنمای پرامپت JSON مفصل به آن پرداختهایم.
۲. متن داخل تصویر، در سطحی متفاوت
بزرگترین برتری عملی این مدل، نوشتن متن است. مدلهای دیگر معمولاً حروف را بههم میریزند؛ نانو بنانا پرو میتواند یک پوستر با سه بلوک متنی مجزا و فونتهای متفاوت بسازد. برای گرفتن بهترین نتیجه:
- متن را داخل گیومه بگذارید تا مدل بداند دقیقاً همین حروف باید بیاید
- برای هر بلوک، سبک فونت را جدا توصیف کنید: «با فونت اسکریپت روان» یا «با سنسریف ضخیم و بلوکی»
- جای هر بلوک را مشخص کنید: «خط بالا»، «زیر محصول»
واقعیت فارسی: پشتیبانی از فارسی بهمراتب ضعیفتر از انگلیسی است. اتصال حروف و شکل نهایی کلمات اغلب خراب میشود، مخصوصاً در جملههای بلند. برای کار حرفهای، تصویر را با فضای خالی برای متن تولید کنید و تایپوگرافی فارسی را بیرون از مدل اضافه کنید.
۳. تا ۱۴ تصویر مرجع همزمان
میتوانید تا ۱۴ تصویر مرجع بدهید و بگویید هرکدام چه نقشی دارد. این برای سه کار خیلی خوب جواب میدهد:
- حفظ هویت چند نفر در یک صحنه (عکس گروهی یا زوج)
- قراردادن یک محصول واقعی در صحنهای جدید، بدون تغییر شکل و برچسبش
- ترکیب ساختار و بافت: «از اسکچ پیوست بهعنوان فرم و از نمونهپارچه بهعنوان بافت استفاده کن»
۴. جستوجوی زنده
مدل به جستوجوی وب دسترسی دارد و میتواند دادهای را بگیرد و تصویری بسازد. مثلاً «آبوهوای فعلی تهران را ببین و صحنه را مطابق آن بساز». نکتهٔ مهم برای واقعنمایی: دانش داخلی مدل تا ژانویهٔ ۲۰۲۵ است؛ هر چیز جدیدتر از آن فقط از راه جستوجو میآید.
۵. ویرایش گفتوگویی
لازم نیست هر بار از صفر شروع کنید. اگر تصویر ۸۰ درصد درست است، همان را نگه دارید و فقط تفاوت را بخواهید. این کار هم سریعتر است، هم آن ۸۰ درصدی را که دوست داشتید حفظ میکند.
مشخصات فنی
| مورد | مقدار |
|---|---|
| نام رسمی | Gemini 3 Pro Image |
| رزولوشن خروجی | ۱K، ۲K، ۴K |
| نسبتهای تصویر | ۱:۱، ۳:۲، ۲:۳، ۳:۴، ۴:۳، ۴:۵، ۵:۴، ۹:۱۶، ۱۶:۹، ۲۱:۹ |
| حداکثر تصویر مرجع | ۱۴ |
| پنجرهٔ ورودی | ۶۵٬۵۳۶ توکن |
| فرمتهای ورودی | PNG، JPEG، WebP، HEIC، HEIF — و متن و PDF |
| تاریخ دانش | ژانویهٔ ۲۰۲۵ |
| نشانهگذاری خروجی | واترمارک نامرئی SynthID و اطلاعات اصالت C2PA |
ساختار پرامپت برای این مدل
گوگل خودش دو الگو را توصیه میکند. اولی برای تولید از صفر:
[سوژه] + [کنش] + [محیط] + [ترکیببندی] + [سبک]
و دومی وقتی تصویر مرجع دارید — که ساختار متفاوتی میخواهد:
[تصاویر مرجع] + [نقش هرکدام] + [صحنهٔ جدید]
تفاوت مهم در الگوی دوم این است که باید رابطهٔ تصاویر مرجع را توضیح دهید، نه فقط آنها را پیوست کنید. «از این بهعنوان چهره و از آن بهعنوان لباس استفاده کن» خیلی بهتر از پیوستکردن ساکت دو عکس جواب میدهد.
یک نمونهٔ کامل
از تصویر مرجع آپلودشده بهعنوان تنها مرجع هویت استفاده کن؛
ساختار چهره، سن، رنگ پوست و حالت طبیعی را دقیقاً حفظ کن
و زیباسازی نکن.
[سوژه] مردی سیساله با ژاکت جیر بژ و تیشرت سفید.
[کنش] به دیوار سنگی بافتدار تکیه داده، یک دست در جیب،
نگاه رو به بیرون از کادر.
[محیط] کوچهای آفتابخورده در ساعت طلایی.
[ترکیببندی] نمای متوسط، سوژه در یکسوم راست، عمودی ۴:۵.
[نور] نور گرم کمارتفاع از سمت چپ، سایههای تیز روی دیوار.
[دوربین] لنز ۳۵ میلیمتری، f/1.8، عمق میدان کم.
[سبک] تنهای خاکی کدر، دانهٔ ظریف فیلم.
حفظ یکدستی شخصیت در چند تصویر
سختترین کار در تصویرسازی هوش مصنوعی این است که یک شخصیت در چند تصویر مختلف همان شخصیت بماند. موثرترین روش شناختهشده، ساختن یک «شیت شخصیت» است: در یک تولید، چند نمای مختلف از همان شخصیت را در یک قاب بخواهید — نمای روبهرو، نیمرخ، سهرخ. بعد از همان تصویر بهعنوان مرجع برای تولیدهای بعدی استفاده کنید.
روش دوم که در گالری زیاد دیده میشود، خواستن یک شبکهٔ چندپنلی در همان تولید است — مثلاً یک شبکهٔ ۳ در ۳ با نُه ژست مختلف و نور یکسان. چون همه در یک بار تولید میشوند، یکدستی بهمراتب بهتر است.
وقتی نانو بنانا پرو انتخاب درستی نیست
هیچ مدلی برای همهچیز بهترین نیست. مواردی که بهتر است سراغ گزینهٔ دیگری بروید:
- متن فارسی داخل تصویر: هیچ مدلی هنوز قابل اتکا نیست — کار را بیرون از مدل انجام دهید
- سبکهای تصویرسازی بسیار خاص هنری: مدلهایی مثل میدجرنی هنوز در حس هنری و اتمسفر دست بالا را دارند
- تولید انبوه و ارزان: برای صدها تصویر ساده، مدلهای سبکتر مقرونبهصرفهترند
- محتوای حساس: فیلترهای ایمنی گوگل سختگیرند و خیلی از درخواستها رد میشوند
هشت اشتباه رایج مخصوص این مدل
- کپیکردن پرامپتهای قدیمی: بندهایی مثل «masterpiece, award winning, trending on artstation» برای مدلهای نسل قبل بود و اینجا فقط پرامپت را شلوغ میکند
- پیوستکردن تصاویر مرجع بدون توضیح نقششان
- نگفتن «زیباسازی نکن» که باعث میشود چهره صاف و بیشباهت شود
- بیان منفی: «بدون ماشین» احتمال ظاهرشدن ماشین را بیشتر میکند؛ بنویسید «خیابان خالی»
- بازنویسی کامل بهجای استفاده از ویرایش گفتوگویی
- ننوشتن نسبت تصویر
- انتظار دانش بهروز بدون فعالکردن جستوجو
- دستورهای متناقض در یک پرامپت — مدل یکی را انتخاب میکند و معمولاً آن یکی نیست که شما میخواستید
پرامپتهای آمادهٔ نانو بنانا پرو
در گالری پینکپیکس حدود ۱۹۰ پرامپت فارسی مخصوص نانو بنانا پرو با تصویر خروجی منتشر شده — متن کامل هر پرامپت روی صفحهاش هست و میتوانید کپی کنید و تغییر دهید. دستههای پرکاربرد:
- پرتره — بیشترین حجم گالری، شامل قفل هویت و نورپردازی استودیویی
- عکاسی محصول — از فلتلی تا نمای انفجاری
- پوستر و گرافیک — جایی که توانایی متن این مدل بهکار میآید
- ادیتوریال — لوک مجلهای و کمپین برند
پرسشهای پرتکرار
نانو بنانا با نانو بنانا پرو چه فرقی دارد؟
نسخهٔ پرو روی مدل بزرگتر Gemini 3 Pro سوار است و در استدلال، متن داخل تصویر و جزئیات دقیقتر است. نسخهٔ معمولی سریعتر و ارزانتر است و برای کارهای ساده کافی. برای پوستر، تایپوگرافی و صحنههای چندعنصری، تفاوت محسوس است.
آیا فارسی را میفهمد؟
بله، توصیف صحنه به فارسی را خوب میفهمد. اما اصطلاحهای فنی عکاسی را انگلیسی بنویسید و برای نوشتن متن داخل تصویر به فارسی حساب باز نکنید — این دو موضوع کاملاً جدا هستند.
چرا خروجی من ۴K نیست؟
رزولوشن باید صراحتاً در تنظیمات یا پرامپت مشخص شود، وگرنه خروجی پیشفرض ۱K است. برای وب ۱K کافی است؛ برای چاپ یا کراپ بعدی، ۲K به بالا بگیرید.
واترمارک SynthID یعنی چه؟
یک نشانهٔ نامرئی در پیکسلهای تصویر که قابل حذف با کراپ یا فشردهسازی نیست و مشخص میکند تصویر ساختهٔ هوش مصنوعی است. علاوه بر آن، اطلاعات اصالت C2PA هم در فایل ذخیره میشود. برای کارهای تبلیغاتی و رسانهای این را در نظر داشته باشید.
چند تصویر مرجع بدهم بهتر است؟
تا ۱۴ تصویر ممکن است، اما بیشتر همیشه بهتر نیست. برای حفظ چهره، دو تا سه عکس واضح از زوایای مختلف معمولاً بهترین نتیجه را میدهد. مهمتر از تعداد، این است که نقش هر تصویر را در پرامپت توضیح دهید.
برای مرور اصول پایهای که در همهٔ مدلها مشترک است، به راهنمای کامل پرامپتنویسی تصویر برگردید. و اگر میخواهید پرامپتهایتان تکرارپذیر و قابل استفادهٔ مجدد شوند، راهنمای پرامپت JSON قدم بعدی است.