GPT
A

audio-flamingo-3-hf

קוד פתוח

nvidiaother2025-10-24

  • transformers
  • safetensors
  • audioflamingo3
  • text2text-generation
  • audio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

חיבור ישיר בין מקודד אודיו ייעודי לבין מודל שפה, שמנתח עד 10 דקות של דיבור, מוזיקה ורעשי רקע יחד.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 32.1 GBמשקל הקבצים
  • 69,511הורדות בחודש

מה זה

הארכיטקטורה משלבת את מקודד AF-Whisper עם המודל Qwen2.5-7B דרך מתאם מבוסס MLP. במקום להסתפק בתמלול מילים רגיל, הוא קולט קובצי אודיו שלמים ומסוגל לענות על שאלות שמערבות צלילי סביבה, זיהוי כלי נגינה או ניתוח שיחה שלמה עד אורך של 10 דקות.

הוא שונה ממודלי שמע פשוטים בכך שהוא תומך בשרשרת חשיבה לפי דרישה ומעבד חלונות של 30 שניות עד למגבלת הקלט הכוללת. התוצאות מראות שיפור על פני 20 מבחני ביצועים של הבנת קול והסקה לוגית מסאונד, מה שאומר שהוא מתמודד טוב יותר מהקיים עם שאלות מורכבות על מה שמתרחש בהקלטה.

מתאים ל

  • תחקור הקלטות ארוכות באנגלית

    קליטה של עד עשר דקות שמע ברצף ומענה על שאלות מורכבות לגבי הנאמר.

  • ניתוח מוזיקה וצלילי סביבה

    זיהוי כלי נגינה, אירועים קוליים ורעשי רקע שלא קשורים למלל מדובר.

  • מחקר אקדמי בהסקה קולית

    הפעלת שרשרת חשיבה להבנת אירועים מורכבים בתוך קובצי סאונד.

איפה זה נופל

הקלט מוגבל ל־10 דקות וכל מה שמעבר נחתך מיד. פלט הטקסט נעצר ב־1024 טוקנים, כך שהוא לא מתאים להפקת תמלולים ארוכים מאוד ברצף. בנוסף, מודל התמלול מדביק לפעמים משפטי פתיחה קבועים לתשובה, והשפה היחידה שמוגדרת בכרטיס היא אנגלית, בלי שום עדות לתמיכה בעברית.

אותה משפחה

audio-flamingo-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין הקלטות בעברית?

הכרטיס מציין אנגלית בלבד. המודלים שעליהם הוא מתבסס מאומנים בעיקר על אנגלית ומאגרי מידע ייעודיים, כך שסביר מאוד שהוא ייכשל בעיבוד עברית.

אפשר להכניס אותו לקוד של שירות מסחרי?

לא. הרישיון של אנבידיה אוסר במפורש כל שימוש מסחרי ומגדיר את המודל לצורכי מחקר בלבד.

איך מריצים

32.1 גיגה בייט של משקלים אומרים שצריך כרטיס מקצועי, כשבתיעוד מצוינים רשמית רק A100 ו־H100 על לינוקס. כדי להריץ אותו בקצב שפוי כדאי להשתמש ב־vLLM שמקצר את זמן התגובה פי 5 עד 7, או להפעיל Flash Attention 2 ו־torch.compile אם אתם נשארים בתוך Transformers.

אם אין לכם גישה לשרת עם כרטיס של 40 או 80 גיגה זיכרון, עדיף להשתמש ב־API מנוהל שמחזיק מודלי שפה ואודיו. פריסה מקומית של המודל הזה כבדה מדי לחומרה שולחנית רגילה.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="nvidia/audio-flamingo-3-hf")
print(pipe("שלום"))

הרישיון

הרישיון הוא NVIDIA OneWay Noncommercial שמגביל את השימוש למחקר בלבד. אסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או אפליקציה שמניבה רווח, וקיימת גם כפיפות לתנאי הרישיון של Qwen ו־OpenAI.

הרישיון המלא בעמוד המודל ↗