Google Lyria 音樂生成模型

https://gemini.google.com/music

Google Lyria 是由 Google DeepMind 所開發的先進 AI 音樂生成基礎模型。它具備極高的高保真度(High-Fidelity)音訊合成能力,能理解複雜的音樂結構,並將使用者的文字、圖像或影片指令轉化為高品質的樂曲。

以下為您詳細介紹 Lyria 的核心功能、應用場景與核心特色:

一、 核心功能

  • 多模態輸入生成(Multimodal Generation):
  • 使用者除了可以使用文字描述曲風與情緒外,還能上傳圖片或影片。Lyria 能感知視覺素材中的情感基調,為其量身打造相符的配樂。
  • 人聲與歌詞生成(Vocal & Lyrics Generation):
  • Lyria 3(及 Pro 版本)支援自然人聲演唱。使用者可以輸入自訂歌詞(例如使用 [Verse 1]、[Chorus] 等結構標籤),或是由 AI 根據提示詞自動生成歌詞與旋律。模型更支援包含英文、日文、韓文、西班牙文等多國語言的歌曲演唱。
  • 精細的結構與參數控制:
  • 創作者可以透過提示詞指定極為精細的音樂結構。例如設定時間戳記([00:00-00:30] 鋼琴獨奏,隨後加入鼓點)、指定歌曲調號(如 A 大調)、節拍率(BPM)以及音樂片段的強弱烈度(Intensity)。
  • 即時動態生成(Lyria RealTime):
  • 提供實驗性的即時音訊流生成功能,讓創作者能在毫秒級的延遲內,流暢地在不同的樂器、曲風和情緒之間進行動態切換與過渡。

二、 主要特色

  • 高品質與結構連貫性:
  • Lyria 3 Pro 支援生成具備清晰音樂結構(主歌、副歌、橋段)且長達數分鐘的高品質音軌(最高可達 44.1 kHz / 48 kHz 立體聲),克服了過往 AI 音樂容易流於片段、缺乏整體敘事感的問題。
  • 負向提示詞(Negative Prompting)支援:
  • 允許使用者明確排除不想要的音樂元素,例如在提示詞中加入「不要電子鼓聲」或「人聲不要太尖銳」,讓成品更符合預期。
  • 負責任的 AI 與版權防護(SynthID 水印):
  • 這是 Lyria 最具指標性的特色。Google 將 SynthID 技術應用於 Lyria 生成的音訊中,在不影響人類聽覺體驗的前提下,為音訊嵌入不可察覺但可被偵測的數位浮水印。這能有效識別該音樂是否由 AI 生成,同時系統也內建內容安全過濾器、背誦檢查(避免抄襲現存歌曲)與藝術家意圖檢查。

三、 應用場景

  • Gemini 系列應用程式(日常與社群創作):
  • Lyria 已整合進 Gemini 中,一般用戶能快速生成 30 秒的短音軌、自訂手機鈴聲、社群媒體配樂或個人娛樂,並自動配上由 Nano Banana 模型生成的精美專輯封面。
  • 專業影音配樂與遊戲開發:
  • 影片創作者與遊戲開發者可以將影片或分鏡圖上傳,利用 Lyria 快速產出符合畫面節奏與氛圍的 production-ready 原創襯底音樂(Musical Bed),大幅縮短配樂工程的時間。
  • AI 輔助歌曲創作(Remix 與音樂實驗):
  • 音樂人可透過 Google AI Studio API 呼叫 Lyria 模型(如 Lyria 3 Clip 或 Lyria RealTime),在進行新歌發想時,用它來實驗不同的編曲比例、樂器組合、動態過渡或生成虛擬人聲和聲。
  • 智慧生活情境整合:
  • 例如「Lyria 智慧鬧鐘」應用,系統能根據使用者當天的行事曆、在地天氣與地理位置,在每天早晨即時為其作曲並播放一首全世界獨一無二的專屬喚醒音樂。

 

🎵 Google Lyria 音樂提示詞黃金結構

一個完整的音樂提示詞,可以依序由以下五個部分組合而成:

1. 主導風格與類型 (Genre & Style) —— 核心基調

  • 說明:明確指出音樂的大分類,這是模型建立節奏與和弦基礎的依據。
  • 關鍵字:90s Lo-Fi Hip-Hop, Synthwave, Cinematic Orchestral, Modern K-Pop, Indie Folk.

2. 情緒與氛圍 (Mood & Atmosphere) —— 情感靈魂

  • 說明:描述音樂想傳達的感覺或場景畫面感。AI 會根據這些詞彙調整大調/小調、音色明暗度與速度。
  • 關鍵字:Nostalgic, Uplifting, Melancholic, Cyberpunk, Dreamy, High-energy.

3. 配器與編排 (Instrumentation) —— 樂器指定

  • 說明:指定你希望聽到的主要樂器與配角樂器,甚至可以指定樂器的音色特質。
  • 關鍵字:Acoustic guitar, Warm analog synths, Heavy bassline, Crisp vinyl crackle, Grand piano.

4. 節奏與速度 (Tempo & Rhythm) —— 時間骨架

  • 說明:控制音樂的快慢與律動感。
  • 關鍵字:Chill 80 BPM, Fast-paced, Driving 120 BPM, Smooth groove, Four-on-the-floor beat.

5. 音訊質感與生產標準 (Audio Quality & Production) —— 最終修飾

  • 說明:定義聲音的空間感、錄音年代感或混音品質。
  • 關鍵字:Studio quality, Lo-Fi textures, Reverb-drenched, Clean mix, Dolby Atmos spatial feel.

💡 實戰提示詞範例模板

你可以直接將以下結構組合起來,根據需求替換括號中的內容:

範例一:復古未來感(適合科技或放鬆氛圍)

提示詞:

80s Synthwave, cyberpunk mood, driving 115 BPM rhythm. Featuring retro analog synthesizers, a heavy pulsing bassline, and crisp electronic drums. Dreamy yet energetic atmosphere, studio quality, wide stereo imaging.

範例二:溫暖療癒感(適合日常或大自然畫面)

提示詞:

Indie Folk, nostalgic and uplifting mood, cozy 75 BPM. Prominent warm acoustic guitar strumming, soft piano chords, and a gentle tambourine. Natural acoustic textures, intimate bedroom studio recording feel, clean mix.

範例三:史詩電影感(適合壯麗或運動流暢感)

提示詞:

Cinematic Orchestral, epic and powerful mood, slow building to a grand peak. Powerful string ensemble, deep brass, and thunderous cinematic percussion. Vast spatial reverb, Dolby Atmos feel, high-end movie soundtrack quality.

🛠️ 進階撰寫技巧

  • 避免使用否定詞:AI 對「不要什麼」的理解較弱。與其寫 "No electric guitar",不如直接寫 "Pure acoustic instruments"。
  • 善用場景聯想:Lyria 對具象場景的理解力很好。在提示詞中加入如 "Sunset drive"(日落馳騁)或 "Rainy coffee shop"(雨天咖啡廳)等詞彙,能讓 AI 自動捕捉最適合該場景的隱含音色。
  • 結構權重:通常寫在最前面的詞彙對音樂影響最大,因此請務必將「音樂類型(Genre)」放在首位。
© 2026 JoyCat.org 版權所有.