GPT
M

music-flamingo-2601-hf

קוד פתוח

nvidiaother2026-01-01

  • transformers
  • safetensors
  • musicflamingo
  • text2text-generation
  • music/songs

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שמבין מוזיקה לעומק ולא רק מתמלל מילים או מנחש ז'אנר. הוא מנתח הרמוניה, מבנה וכלי נגינה בקטעים של עד עשרים דקות ברצף.

  • 8.3Bפרמטרים
  • 1,200טוקנים בהקשר
  • 15.4 GBמשקל הקבצים
  • 22,263הורדות בחודש

מה זה

הארכיטקטורה מחברת מקודד אודיו בשם AF-Whisper עם המודל השפתי Qwen2.5-7B דרך מתאם ייעודי, ומגיעה ל־8.3 מיליארד פרמטרים. המערכת מקבלת קובצי אודיו בפורמטים נפוצים כמו MP3, WAV ו־FLAC, ומחזירה תשובות טקסטואליות מפורטות. האימון שלה התבסס על בין עשרת אלפים למיליון שעות של מוזיקה, תוך שימוש בלמידת חיזוק וחשיבה מובנית כדי לנתח תאוריה מוזיקלית, גוון צליל ומשמעות תרבותית.

בניגוד למודלי שפה כלליים שמקבלים אודיו כעוד סוג של קלט שטחי, כאן הושם דגש על הבנה מוזיקלית עמוקה. לפי כרטיס המודל, הוא קבע שיאים ביותר מעשרה מבחני ביצועים ציבוריים שבודקים הבנה והסקה על קטעי שמע, כולל מענה על שאלות מורכבות סביב מבנה השיר וההרמוניה שלו.

מתאים ל

  • ניתוח תאורטי של קטעי נגינה

    הוא מזהה מבנים מוזיקליים, כלי נגינה והרמוניה ברמת פירוט גבוהה מתוך קובץ שמע.

  • מענה על שאלות מקבצי שמע

    מאפשר לשאול שאלות מורכבות על שירים מלאים באורך של עד 20 דקות ולקבל תשובות מנומקות.

  • מחקר אקדמי של מוזיקה

    מתאים לחוקרים שרוצים לבחון יכולות הסקה ולמידת חיזוק על דאטה מוזיקלי נרחב.

איפה זה נופל

המודל מעבד שמע בחלונות של 30 שניות ומגביל את הקלט כולו ל־20 דקות בלבד, כך שכל מה שמעבר לזה ייחתך אוטומטית. חלון ההקשר מוגבל והפלט הטקסטואלי נעצר ב־2048 טוקנים. בנוסף, המודל אומן רק באנגלית, כך שאינו מיועד לפענוח או ניתוח של שירים בעברית או תכנים מקומיים. כרטיס המודל גם מדגיש שנדרשות בדיקות איטרטיביות לפי מתודולוגיית V-model לפני שילוב במערכות אמת כדי לצמצם שגיאות וסיכוני בטיחות.

שאלות
נפוצות

האם אפשר להשתמש במודל במוצר מסחרי?

לא. הרישיון של אנבידיה קובע במפורש שהמודל מיועד למטרות מחקר לא מסחריות בלבד, ולכן אי אפשר לשלב אותו במוצר שמייצר הכנסות.

האם המודל ינתח שירים בעברית?

השפה המוגדרת למודל היא אנגלית בלבד. הוא מסוגל לשמוע מוזיקה מכל סוג, אך ההבנה של שירה בעברית והמענה בטקסט לא נתמכים באופן רשמי.

איזה כרטיס מסך צריך כדי להריץ אותו?

המשקל שלו הוא מעל 15 גיגה-בייט והוא דורש מעבד גרפי חזק עם זיכרון רחב. אנבידיה בדקה אותו על A100 של 80 גיגה-בייט, כך שכרטיסים ביתיים פשוטים יתקשו להתמודד איתו.

איך מריצים

המודל שוקל 15.4 גיגה-בייט, ואפשר להריץ אותו בעזרת ספריית transformers של פייתון על מערכות לינוקס. אנבידיה בדקה אותו על גבי כרטיס A100 עם 80 גיגה-בייט זיכרון גרפי, ותומכת רשמית בארכיטקטורות Ampere ו־Hopper. אם יש לכם חומרה מתאימה תוכלו להפעיל Flash Attention 2 או לבצע אופטימיזציה עם torch.compile כדי להאיץ את זמני הריצה, אך שימו לב ששני המנגנונים האלה לא עובדים יחד.

למשתמשים בלי כרטיסי מסך ארגוניים חזקים, הרצה מקומית עלולה להיות כבדה ולא יעילה. במקרים כאלה עדיף לחכות שספקי ענן יציעו גישה מנוהלת, או להשתמש בהדגמות קיימות במקום להחזיק שרת יקר ייעודי.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="nvidia/music-flamingo-2601-hf")
print(pipe("שלום"))

הרישיון

השימוש מוגבל למחקר בלבד תחת רישיון NVIDIA OneWay Noncommercial License, בתוספת תנאי הרישיון של Qwen ותנאי השימוש של OpenAI. אסור להשתמש במודל הזה במוצר מסחרי, באפליקציה בתשלום או בפעילות עסקית מניבה.

הרישיון המלא בעמוד המודל ↗