GPT
M

music-flamingo

רץ בדפדפן

nvidiaapache-2.02025-11-11

  • gradio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מעלים קובץ שמע או קישור מיוטיוב, שואלים שאלה טקסטואלית ומקבלים ניתוח של המוזיקה. זה מיועד למי שרוצה לתחקר קטעי קול בלי לתמלל או לקודד בעצמו.

  • הורדות בחודש
  • 204לייקים

מה זה

אתם מספקים קובץ אודיו ישירות מהמחשב או מדביקים כתובת של סרטון יוטיוב, והמערכת מחלצת את הצליל לבד. מתחת מזינים שאלת טקסט חופשית על מה ששומעים, למשל על כלי הנגינה, המבנה או האווירה בקטע, ויש גם דוגמאות מובנות של שאילתות וקישורים כדי לראות איך זה עובד.

בצד הטכני רץ המודל nvidia/music-flamingo-2601-hf בעזרת MusicFlamingoForConditionalGeneration של transformers, יחד עם שימוש ברכיבי audio-flamingo ונתוני MF-Skills. התוצאה הסופית שמוחזרת למסך היא תשובת טקסט שמנתחת את האודיו בהתאם לפרומפט שכתבתם.

מתאים ל

  • ניתוח כלי נגינה

    זיהוי הכלים הפעילים בקטע שמע או בסרטון יוטיוב באמצעות שאלת טקסט ממוקדת.

  • תחקור מבנה מוזיקלי

    קבלת פירוט על שינויי קצב, סגנון ואווירה לאורך השיר ישירות לחלון הטקסט.

  • בדיקת תוכן אודיו

    חילוץ תובנות מהירות על קובצי קול בלי להקשיב לכל ההקלטה מתחילתה ועד סופה.

איפה זה נופל

הכלי מחזיר טקסט בלבד ולא מייצר אודיו חזרה. אם הקישור ליוטיוב נחסם, נמחק או מוגבל גאוגרפית, חילוץ הצליל ייכשל עוד לפני שהמודל מתחיל לעבוד. בנוסף, מודלים של הבנת אודיו עלולים לפספס רבדים בהקלטות עמוסות או לזהות כלי נגינה שלא קיימים, ולכן אי אפשר להסתמך על התוצאות לניתוח מוזיקלי מקצועי בלי בדיקה ידנית של הקטע המקורי.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

הגישה לממשק פתוחה בחינם בדפדפן דרך Hugging Face. אין צורך להכניס אמצעי תשלום כדי להעלות קבצים או לבדוק קישורים. כל עוד החומרה הזמינה מקצה משאבים, אפשר להשתמש בה ללא עלות.

מה קורה עם קובצי השמע שאני מעלה?

הקוד שומר את האודיו בתיקייה זמנית על השרת לצורך העיבוד והרצת המודל. הקבצים לא אמורים להישמר לתמיד בממשק, אך מדובר בסביבה ציבורית ולכן לא מומלץ להעלות חומרים סודיים או הקלטות פרטיות.

במה הממשק הזה שונה מהרצת המודל ישירות?

כאן מקבלים דף אינטרנט מוכן שכולל הורדה אוטומטית מיוטיוב ותיבות טקסט לשאלות ותשובות. בהרצה ישירה בקוד תצטרכו להוריד את המשקלים של nvidia/music-flamingo-2601-hf, לנהל בעצמכם סביבת פייתון ולהחזיק מעבד גרפי מתאים.

האם אפשר להריץ את זה על המחשב שלי?

אפשר למשוך את המודל והקוד כי הם מבוססים על transformers ורישיון apache-2.0. עם זאת, תצטרכו מחשב חזק עם כרטיס מסך שמסוגל להתמודד עם מודל שרץ על חומרת A10G, אחרת העיבוד יהיה איטי מאוד.

איך משתמשים

בוחרים קובץ קול או מקלידים קישור יוטיוב ולוחצים על כפתור הטעינה כדי לחלץ את האודיו. אחרי שהשמע נקלט והזנתם שאלה, לוחצים על Generate Answer וממתינים. זה רץ על חומרת zero-a10g שמקצה כוח עיבוד של A10G לפי דרישה, כך שאין צורך בהתקנות או בהגדרת שרת אבל זמני התגובה תלויים בעומס ובמשך הזמן שלוקח לטעון את הווידאו מיוטיוב.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0, שמאפשר שימוש חופשי ושינוי קוד כולל לצרכים מסחריים לפי תנאי הרישיון. הקוד עצמו מוריד קבצים מסרטוני יוטיוב לתיקייה זמנית בשרת לצורך העיבוד, כך שזכויות היוצרים על השירים עצמם שייכות ליוצריהם המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗