GPT
A

audio-flamingo-3 — הדגמה

קוד פתוח

nvidiaother2025-07-10

  • gradio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הכלי מנתח קובצי שמע ומחזיר עליהם תשובות טקסטואליות לפי הנחיות שתקלידו. הוא מיועד לחוקרים ולמפתחים שרוצים לבחון הבנת דיבור, מוזיקה וצלילים.

  • 16.7 GBמשקל הקבצים
  • הורדות בחודש
  • 102לייקים

מה זה

מזינים למערכת קובץ שמע של עד 10 דקות ומקלידים שאלת טקסט חופשית לגבי התוכן שלו. בתגובה מקבלים תשובה כתובה שמנתחת את מה שנשמע, כולל זיהוי אירועים קוליים, מוזיקה או שיחה. אם מבקשים ממנו מפורשות לחשוב לעומק, הוא מציג שרשרת חשיבה והסברים לפני המסקנה הסופית.

מאחורי הממשק רצים מודל בסיס של שבעה מיליארד פרמטרים ממשפחת Qwen2.5, מקודד שמע ייעודי בשם AF-Whisper, ומתאם מסוג MLP. הקוד טוען משקלים ישירות ממאגרים של אנבידיה ומשתמש בטכניקת PEFT בשביל שלב החשיבה המעמיקה. בלשוניות ההדגמה מופיעים קישורים להרצה בסיסית של שאלה ותשובה לצד מצב ניתוח ממושך.

מתאים ל

  • תמלול והבנת דיבור

    העלאת קובץ קולי וקבלת מענה על שאלות בנוגע לנאמר בו.

  • ניתוח צלילים ומוזיקה

    זיהוי כלי נגינה, קטעי שירה ואירועים אקוסטיים בהקלטה.

  • הסבר מנומק על שמע ארוך

    ניתוח קבצים של עד עשר דקות בליווי שלבי חשיבה מפורטים.

איפה זה נופל

ההדגמה אינה פועלת כרגע בעקבות שגיאת בנייה בשרת, ולכן אי אפשר לבדוק אותה ישירות בדפדפן. שתי לשוניות שלמות בקוד, שנועדו לשיחה מתמשכת ולדיבור קולי, נוטרלו בהערות ומפנות למרחב נפרד. כמו כן, כדי להפעיל את מנגנון ההסבר המלא צריך להוסיף ידנית משפט הנחיה ספציפי לפרומפט, אחרת המודל מחזיר רק מענה שטחי.

אותה משפחה

audio-flamingo-3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם השימוש בהדגמה כרוך בתשלום?

הגישה לעמוד בהאגינג פייס פתוחה בחינם ללא צורך במנוי בתשלום. עם זאת, נכון לעכשיו העמוד סובל משגיאת בנייה ולא ניתן לתפעל אותו.

האם אפשר להריץ את המערכת על המחשב הפרטי?

כן, הקוד המלא זמין להורדה מגיטהאב תחת רישיון MIT. המשקלים פתוחים להורדה ממאגרי החברה, אך מותר להשתמש בהם למחקר בלבד ולא למטרות מסחריות.

כמה זמן לוקח לקבל תשובה?

בעמוד מוגדר מעבד בסיסי בלבד ללא האצת חומרה. מודל בגודל שבעה מיליארד פרמטרים על תשתית כזאת ידרוש זמן המתנה ממושך מאוד לכל שאילתה.

האם אפשר לנהל שיחה קולית רציפה בממשק?

לא, הלשוניות של שיחה מרובת שלבים וקלט קולי נוטרלו בקוד של הדף הנוכחי. המפתחים הפנו את המשתמשים שמעוניינים בצ'אט קולי לדמו מקביל בשם audio-flamingo-3-chat.

איך מריצים

טוענים קובץ אודיו בפורמט נתמך, כותבים שאלה בתיבת הטקסט ולוחצים על הכפתור שמייצר את התשובה. הדמו הוגדר על חומרת מעבד בסיסית וללא מאיץ גרפי ייעודי, כך שהרצה כבדה של מודל כזה צפויה להיות אטית מאוד. נכון לעכשיו מופיעה בממשק שגיאת בנייה מלאה שמונעת את הפעלת הדף.

pip install -U huggingface_hub
hf download nvidia/audio-flamingo-3

הרישיון

הקוד פתוח תחת רישיון MIT, אך משקלי המודל מוגבלים לשימוש לא מסחרי בלבד במסגרת הרישיון של אנבידיה ורישיון המחקר של עליבאבא. כל תוכן שתעלו כפוף גם לתנאי השימוש של נתונים שנוצרו על ידי OpenAI.

הרישיון המלא בעמוד המודל ↗