GPT
A

audio-flamingo-3

קוד פתוח

nvidiaother2025-07-10

  • safetensors
  • audio
  • reasoning
  • audio understanding
  • ASR

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל אודיו שפה שמנתח הקלטות שלמות, דיבור, מוזיקה וצלילי סביבה יחד. הוא מעניין כי הוא מטפל בקבצים של עד 10 דקות ומאפשר שיחה קולית רציפה וחשיבה לפני מענה.

  • 16.7 GBמשקל הקבצים
  • 445הורדות בחודש
  • 159לייקים

מה זה

במקום לתפור מודל תמלול נפרד ומודל שפה נפרד, המערכת הזו מחברת אנקודר אודיו בשם AF Whisper ישירות למודל שפה מסוג Qwen2.5 בנפח שבעה מיליארד פרמטרים. התוצאה היא מודל שמבין אודיו כשפת מקור, ולא רק כטקסט מתומלל, כך שהוא מזהה ניואנסים של קול, כלי נגינה ורעשי רקע.

הוא מסוגל לעבד חלונות קול של עד עשר דקות, לקבל הוראות טקסטואליות או קוליות, ולייצר תשובה בטקסט או בהזרמת דיבור ישירה. כרטיס המודל מציג עמידה במבחנים ביותר מעשרים מבחני ביצועים שונים, מה שאומר שהוא יציב יותר בניתוח משימות מורכבות של הבנת צליל לעומת חיבורים פשוטים של Whisper למודל שפה רגיל.

מתאים ל

  • ניתוח הקלטות שמע ארוכות

    מאפשר לשאול שאלות על קובצי פודקאסטים או שיחות של עד 10 דקות ישירות מהסאונד.

  • סיווג צלילי סביבה ומוזיקה

    מזהה כלי נגינה, אירועים קוליים ורעשי רקע שאינם דיבור אנושי בעזרת האנקודר המשולב.

  • מחקר ממשקי קול לקול

    מתאים לבדיקת שיחות מרובות תורות והזרמת דיבור ישירה בחזרה למשתמש בסביבת מעבדה.

איפה זה נופל

הקלט מוגבל בקשיחות לעשר דקות, וכל קטע ארוך מזה פשוט נחתך בלי שאלות. בנוסף, העיבוד נעשה בחלונות של שלושים שניות, מה שיכול לייצר עיוותים ברצף של צלילים ארוכים. התמיכה המדווחת היא באנגלית בלבד, כך שאין מה לבנות עליו לעברית בלי אימון ייעודי. עוד עניין מעצבן הוא מנגנון התמלול, שדוחף כברירת מחדל טקסט מקדים קבוע שחייבים לנקות ידנית בעזרת דגל ייעודי בקוד.

אותה משפחה

audio-flamingo-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יבין הקלטות בעברית?

השפה הרשמית המדווחת בכרטיס היא אנגלית בלבד. מודל הבסיס של Qwen מכיר מעט שפות נוספות, אבל אנקודר האודיו ונתוני האימון מיועדים לאנגלית, ולכן דיבור בעברית כנראה יתקבל כרעש או יתומלל עם המון שגיאות.

אפשר להטמיע אותו באפליקציה בתשלום ללקוחות?

לא. הרישיון של אנבידיה קובע מפורשות שהשימוש מוגבל למחקר ללא מטרות רווח. מעבר לזה, המודל מתבסס על נתונים שקשורים לתנאי השימוש של OpenAI ו־Qwen, מה שמסבך עוד יותר כל כוונה מסחרית.

איך מריצים

כדי להריץ אותו צריך כרטיס גרפי כבד. המשקל הגולמי של הקבצים עומד על 16.7 ג'יגה בייט, ובבדיקות של אנבידיה הם השתמשו ב־A100 עם 80 ג'יגה בייט זיכרון. על כרטיסים ביתיים עם 16 או 24 ג'יגה זה יהיה גבולי מאוד וידרוש קוונטיזציה או שימוש ב־SDPA ו־Flash Attention 2 כדי לא לחנוק את הזיכרון.

ההרצה עצמה פשוטה ברמת הקוד ונתמכת ישירות דרך ספריית Transformers של HuggingFace. יש אפשרות להאיץ את הביצועים עם torch compile במצב סטטי, אבל אם אין לכם גישה לשרת עם כרטיסי A100 או H100 זמינים בענן, שווה לחפש נקודת קצה של API במקום לנסות לדחוף את זה למחשב מקומי.

pip install -U huggingface_hub
hf download nvidia/audio-flamingo-3

הרישיון

הרישיון מוגדר תחת NVIDIA OneWay Noncommercial License, ומחייב גם את תנאי השימוש של Qwen ושל OpenAI בגלל אופן יצירת הנתונים. בעברית פשוטה, אסור להשתמש במודל הזה בשום מוצר מסחרי, שירות בתשלום או סביבת ייצור שמייצרת הכנסה. הוא מיועד למחקר ולניסויים בלבד.

הרישיון המלא בעמוד המודל ↗