GPT
A

audio-flamingo-next-hf

קוד פתוח

nvidiaother2026-04-05

  • transformers
  • safetensors
  • musicflamingo
  • text2text-generation
  • audio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שיודע להקשיב לקובצי קול באורך של עד שלושים דקות ולענות על שאלות לגביהם. הוא משלב תמלול, זיהוי מוזיקה וניתוח צלילים כלליים.

  • 8.3Bפרמטרים
  • 1,200טוקנים בהקשר
  • 15.4 GBמשקל הקבצים
  • 10,477הורדות בחודש

מה זה

מדובר במודל שפה ושמע בגודל של 8.3 מיליארד פרמטרים שפותח על בסיס מקודד שמע ממשפחת Whisper ומודל שפה ממשפחת Qwen2.5. הייחוד שלו לעומת גרסאות קודמות ולעומת מודלים סטנדרטיים ברמת הגודל הזו הוא היכולת לבלוע קטעי קול ארוכים של עד חצי שעה, תוך חלוקה פנימית למקטעים של שלושים שניות ושמירה על מיקום הזמן באמצעות מנגנון RoTE.

הוא מסוגל לתמלל שיחה מרובת דוברים, לתרגם דיבור, לזהות מבנה מוזיקלי, סגנון וכלי נגינה, ולענות על שאלות מורכבות על סמך אירועים שקרו בהקלטה. ההבדל המרכזי מול מה שהיה קיים עד כה הוא המעבר מאימון על מאגרי מעבדה מצומצמים למאות אלפי שעות וידאו מהרשת, מה שנותן לו יכולת התמודדות טובה יותר עם שמע מציאותי ומלוכלך.

מתאים ל

  • תחקור הקלטות ממושכות

    מענה לשאלות ממוקדות מתוך שיחות או הרצאות של עד חצי שעה ללא צורך לחתוך את הקובץ.

  • תמלול שיחה מרובת דוברים

    זיהוי דוברים שונים והפקת תמלול מסודר עם חלוקה ברורה לפי הוראה מתאימה בפרומפט.

  • קטלוג וניתוח מוזיקה

    חילוץ מאפיינים מוזיקליים כמו סולם, מקצב, סגנון וכלי נגינה מתוך קובצי שמע.

איפה זה נופל

הכרטיס מודה בפירוש שאיסוף המידע מהאינטרנט השאיר פערים באיכות. ההבנה שלו בשפות בעלות מעט משאבים חלשה יחסית, והוא מתקשה לזהות אירועי קול נדירים. בנוסף, כשמזרימים אליו הקלטה ארוכה שבה המידע החשוב מפוזר בנקודות זמן רחוקות זו מזו, הקישור הלוגי בין הרמזים נוטה להישבר. יש לזכור גם שההערכה הרשמית שלו טרם כיסתה באופן מלא משימות מורכבות כמו הפרדת דוברים או כתוביות מתוזמנות היטב.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לשיחה קולית רציפה מול משתמש?

לא. למרות שהפרויקט המחקרי הרחב כולל רכיבי דיבור וקול, המשקלים ששוחררו כאן הם ברמת שמע וטקסט בלבד. המודל מקבל שמע או טקסט ומחזיר טקסט כתוב בלבד.

מה ההבדל בין הגרסה הזו לגרסאות Think או Captioner של הפרויקט?

הגרסה הזו מכוונת לתשובות קצרות וישירות ולשיחה במבנה של צ'אט. גרסת Captioner מתמקדת בתיאור עמוס ומפורט של כל אירועי הרקע, וגרסת Think מיועדת לפירוק שלבי חשיבה מורכבים לפני מתן התשובה.

איך מריצים

המשקל הכולל של הקבצים עומד על 15.4 גיגהבייט. כדי להריץ אותו מקומית צריך כרטיס מסך מודרני עם לפחות 24 גיגהבייט זיכרון גרפי עבור דיוק מלא, או חומרה צנועה יותר אם מפעילים כימות לפורמט 4 ביט או 8 ביט. העיבוד דורש קודם כל המרה של האודיו למקור מונו בקצב דגימה של 16 קילוהרץ לפני שמעבירים אותו לפרוססור של transformers.

אם כל מה שאתם צריכים זה תמלול טהור באנגלית בלי שאלות הבנה ובלי צורך להבין מה קורה ברקע, חבל להעמיס שרת שלם. עבור משימות תמלול פשוטות מודל Whisper רגיל יעשה את העבודה בפחות משאבים, ועדיף להרים את המפלצת הזו רק כשצריך ממש לחקור את תוכן השמע, לשאול שאלות על אירועים קוליים או לחבר דיבור, מוזיקה ורעשי סביבה יחד.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="nvidia/audio-flamingo-next-hf")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון NVIDIA OneWay Noncommercial, לצד תנאי השימוש של Qwen ושל OpenAI. בשורה התחתונה הוא מיועד למחקר בלבד, ואי אפשר לשלב אותו במוצר מסחרי, למכור גישה אליו או להשתמש בו לייצור רווחים ישירים בעסק.

הרישיון המלא בעמוד המודל ↗