Nano Banana Pro 是谷歌最新推出的影像生成模型,自發布以來,AI 社群已利用它創造了海量作品。該模型不僅擅長風格遷移、物體移除、文字渲染和逼真影像等基礎任務,更令人驚歎的是其內建的邏輯推理能力。例如,使用者可以將家庭作業輸入模型,它不僅能給出正確答案,還能展示解題過程。這種能力得益於模型內部的中間提示層,它們像推理橋樑一樣連線輸入影像和最終輸出,使模型能夠理解並上下文響應影像中的文字資訊。
在文字與設計方面,Nano Banana Pro 幾乎可以逐字精確呈現任意文本。無論應用何種風格,文字準確性都不會受到影響。社群使用者已用它生成了包含大量密集資訊的資訊圖表、雜誌封面、設計稿等。例如,有人將輝達 Q3 財報 PDF 生成了一張精美的資訊圖,還有人用印尼語提示建立了準確的雜誌封面,模型沒有出現拼寫錯誤。這意味著設計師可以快速迭代原型,甚至直接使用生成的素材。
角色一致性是 Nano Banana Pro 的另一大亮點。模型可同時處理多達14張參考影像,確保同一角色在不同場景、姿勢和風格下保持一致。使用者可以透過多張影像組合生成新影像,甚至可以更換角色背景而保持其外觀特徵。這種能力對故事板創作、品牌視覺一致性尤為有用,即使經過多次迭代生成,角色特徵也能穩定保留。
在世界知識方面,模型內建了大量現實世界知識,例如能夠根據地理座標識別地標並生成對應的影像。不過,它並非即時聯網,若要獲取最新資訊(如天氣),需要結合搜尋工具。儘管如此,模型自身蘊含的知識量已足以支撐許多應用場景。
開始使用 Nano Banana Pro 的 API 非常簡單。以下是一個 JavaScript 示例:
import Replicate from "replicate";
const replicate = new Replicate({
auth: process.env.REPLICATE_API_TOKEN,
});
const output = await replicate.run(
"google/nano-banana-pro",
{
input: {
prompt: "Your prompt here",
// Additional parameters
}
}
);
console.log(output);社群已經展示了大量創意應用,包括廣告生成、地圖轉衛星檢視、PDF 轉白板摘要、時尚影像網格、漫畫著色與3D化、啤酒廣告概念、帶註釋的示意圖、卡通形象生動化、城市規劃對映,甚至建立完整的 Instagram 個人資料。這些示例充分證明了 Nano Banana Pro 的廣泛潛力。
總而言之,Nano Banana Pro 在保持創意設計自由的同時,提供了畫素級的文字準確性和強大的邏輯推理能力。無論是專業人士還是愛好者,都能從中獲得啟發。立即嘗試,看看你能創作出什麼。