GPT
F

Fun-Audio-Chat-8B

קוד פתוח

FunAudioLLMapache-2.02025-12-23

  • transformers
  • safetensors
  • funaudiochat
  • text-generation
  • audio-language-model

מודל שיחה קולי מקצה לקצה שמדבר ומבין ישירות באודיו, בלי להסתמך על תמלול נפרד באמצע. מתאים למי שרוצה לבנות עוזר קולי מהיר באנגלית או בסינית.

  • 9.5Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.6 GBמשקל הקבצים
  • 439הורדות בחודש

מה זה

הארכיטקטורה כאן מחברת הבנת שמע ויצירת דיבור לתוך רשת אחת של 9.5 מיליארד פרמטרים. במקום לעבוד בקצב דגימה כבד כמו מודלים אחרים, הוא משתמש בייצוג שמע כפול, שלד מהיר של 5 הרץ לצד ראש מעודן של 25 הרץ. החלוקה הזו חוסכת כמעט חצי ממשאבי החישוב בריצה, בלי לפגוע באיכות הדיבור שיוצאת בצד השני.

המפתחים אימנו אותו בשיטה שהם מכנים Core-Cocktail כדי לא לאבד את יכולות הטקסט הרגילות של מודל שפה. במבחני ביצועים של הבנת אודיו ושאלות קוליות כמו VoiceBench, MMAU ו־Speech-BFCL, הוא מציג תוצאות מובילות מול מודלים אחרים סביב 8 מיליארד פרמטרים, במיוחד בהפעלת פונקציות ישירות מפקודות קוליות.

מתאים ל

  • בוט שיחה קולי באנגלית

    מאפשר מענה בדיבור עם שיהוי נמוך והבנת ניואנסים קוליים ישירות מהמשתמש.

  • הפעלת פונקציות מקול

    מפעיל קריאות API ישירות מהוראות שמע בזכות ביצועים גבוהים במבחני Speech-BFCL.

  • ניתוח והבנת קובצי שמע

    מתמודד עם שאלות על הקלטות קוליות מורכבות בהסתמך על חלון הקשר של 262,144 טוקנים.

איפה זה נופל

הבעיה המרכזית שלו היא שפות. המודל הוכשר ותומך רק באנגלית ובסינית, כך שאין כאן שום תמיכה מובנית בעברית, לא בהבנה ולא בהפקה של קול. מי שרוצה להשתמש בו עבור קהל ישראלי יצטרך לבדוק אימון נוסף או לתרגם מסביב.

בנוסף, ריצה מלאה של שיחה קולית מחייבת שילוב של שני מודלים במקביל, המודל הראשי ומודל הקול CosyVoice, מה שמוסיף מורכבות לצינור הנתונים ולניהול הזכרון בפרודקשן.

שאלות
נפוצות

האם המודל מבין או מדבר בעברית?

לא. המודל מאומן רשמית רק על אנגלית וסינית. הוא לא מיועד לשימוש בשפות אחרות בלי אימון ייעודי מראש.

מה נדרש כדי להפיק ממנו תשובה קולית ולא רק טקסט?

המודל מגיע כחלק מארכיטקטורת שיחה קולית, וכדי להריץ הסקה של דיבור לדיבור צריך להוריד ולהריץ במקביל גם את מודל Fun-CosyVoice3-0.5B לפי ההוראות שלהם.

איך מריצים

בשביל להריץ אותו להסקה צריך כרטיס מסך עם לפחות 24 גיגה זיכרון גרפי, סביבת פייתון 3.12 וגרסת פאיטורץ' 2.8.0. הקבצים שוקלים 17.6 גיגה בפורמט bfloat16, וכדי לקבל יכולת דיבור מלאה מקצה לקצה צריך להוריד לצדו גם מודל קול נפרד, Fun-CosyVoice3-0.5B.

אם אתם מתכננים לאמן או לכוונן אותו, הדרישות קופצות לארבעה כרטיסים של 80 גיגה זיכרון. אם אין לכם שרת ייעודי עם כרטיס חזק וחיבור יציב, כנראה יהיה זול ופשוט יותר להישאר עם שירותי ענן במקום לתחזק מכונה מקומית כבדה.

from transformers import pipeline

pipe = pipeline("any-to-any", model="FunAudioLLM/Fun-Audio-Chat-8B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗