GPT
M

music-flamingo-hf

קוד פתוח

nvidiaother2025-11-10

  • transformers
  • safetensors
  • audioflamingo3
  • text2text-generation
  • music/songs

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שמנתח קטעי מוזיקה ושירים שלמים ועונה עליהם בטקסט. הוא מתאים למי שצריך תיאור מוזיקלי מעמיק, כולל מבנה, הרמוניה ומילים, ישירות מקובץ האודיו.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.4 GBמשקל הקבצים
  • 6,858הורדות בחודש

מה זה

הארכיטקטורה מחברת מקודד אודיו ייעודי מבוסס Whisper למודל שפה מסוג Qwen2.5-7B דרך מתאם MLP פשוט. במקום לזהות רק ז'אנר או לתמלל מילים, המודל מאומן להבין תאוריה מוזיקלית, לזהות כלי נגינה, לנתח גוון צליל ולהסביר הקשר תרבותי על פני שירים מלאים. אימנו אותו בשיטות שרשרת חשיבה ולמידת חיזוק כדי שידע לפרק שאלות מורכבות על מוזיקה לשלבים.

בכרטיס מדווח שהמודל קבע תוצאות מובילות בלמעלה מעשרה מבחני ביצועים ציבוריים להבנת מוזיקה והסקה, כמו GTZAN, MMAU ו־MusicQA. בפועל, החידוש העיקרי מול מודלים רב־מודאליים אחרים בגודל שמונה מיליארד פרמטרים הוא ההתמקדות במוזיקה ולא בדיבור כללי, יחד עם היכולת לבלוע קטעי אודיו ארוכים מאוד ברצף.

מתאים ל

  • ניתוח תאורטי של יצירות

    פירוק שיר למבנה, כלי נגינה, הרמוניה ושינויי קצב מתוך קובץ האודיו.

  • מענה לשאלות על תוכן שירים

    בדיקת הקשר בין הטקסט המושר לבין האווירה המוזיקלית של היצירה.

  • תיוג אוטומטי של קטלוג מוזיקה

    הפקת תיאורים טקסטואליים עשירים ומדויקים למאגרי שמע לצורכי מחקר.

איפה זה נופל

בתיעוד יש סתירה מפורשת לגבי אורך האודיו המרבי. במקום אחד מצוין שהקלט מוגבל לעשר דקות וכל מה שמעבר נחתך, ובמקום אחר רשום מקסימום של 20 דקות. בכל מקרה, העיבוד נעשה בחלונות קשיחים של שלושים שניות, מה שעלול לייצר בעיות ברציפות ההבנה של מעברים מוזיקליים עדינים.

בנוסף, הנתונים הרשמיים מציינים תמיכה בשפה האנגלית בלבד. אם תזינו מוזיקה בעברית או תשאלו עליה שאלות בעברית, סביר שתקבלו הזיות או חוסר הבנה מוחלט של הטקסט וההקשר. המודל גם מוגבל לטקסט יוצא בלבד ואינו מייצר מוזיקה.

שאלות
נפוצות

האם המודל יודע לייצר שירים או מוזיקה חדשה?

לא. מדובר במודל הבנה וניתוח בלבד שמקבל אודיו וטקסט, ופולט טקסט בחזרה. הוא לא מסוגל לסנתז קול, לייצר ביטים או להפיק קבצי שמע.

האם אפשר לשלב אותו באפליקציה מסחרית למשתמשי קצה?

לא. הרישיון של אנבידיה מגדיר אותו באופן חד־משמעי למטרות מחקר לא מסחרי בלבד. כל שימוש עסקי או מכירה של שירות המבוסס עליו אסורים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־15.4 גיגה־בייט, ונבדק רשמית על כרטיסי A100 עם 80 גיגה זיכרון. כדי להריץ אותו מקומית באופן סביר תצטרכו כרטיס גרפי של אנבידיה עם 24 גיגה זיכרון לפחות. הקוד נתמך ישירות בספריית transformers, וכולל אפשרות לשימוש ב־Flash Attention 2 או הרצה מואצת דרך torch.compile, כאשר השניים אינם עובדים ביחד.

אם אין לכם שרת ייעודי עם חומרה ברמה הזו, שווה לשקול הרצה מנוהלת בענן או מודל שירות מרוחק. בנוסף, מפתח המודל כבר פרסם גרסה חדשה וחזקה יותר בשם music-flamingo-2601-hf, כך שלפני שמתחילים להוריד שווה לבדוק אם לא עדיף ללכת ישירות על הגרסה העדכנית.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="nvidia/music-flamingo-hf")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת תנאי שימוש לא מסחריים של אנבידיה, עם מגבלות נוספות שנגזרות מחלקי דאטה של Qwen ו־OpenAI. השימוש מותר אך ורק למחקר. אם אתם בונים מוצר מסחרי, תוכנה בתשלום או פיצ'ר לעסק, אסור לכם להשתמש במודל הזה.

הרישיון המלא בעמוד המודל ↗