GPT
G

granite-speech-3.3-8b

קוד פתוח

ibm-graniteapache-2.02025-04-14

  • transformers
  • safetensors
  • granite_speech
  • automatic-speech-recognition
  • multilingual

חיבור ישיר בין מודל שפה של שמונה מיליארד פרמטרים למפענח שמע עבור תמלול ותרגום דיבור. הוא מיועד למי שרוצה עיבוד שמע והבנת טקסט באותה תשתית בלי להחזיק שרתים נפרדים.

  • 8.6Bפרמטרים
  • 131,072טוקנים בהקשר
  • 16.2 GBמשקל הקבצים
  • 40,204הורדות בחודש

מה זה

המודל הזה בנוי משילוב של מקודד שמע מבוסס קונפורמר עם מודל השפה granite-3.3-8b-instruct, לצד מתאם שמוריד את קצב הדגימה של אותות השמע פי עשרה. המבנה שלו עובד בשני שלבים נפרדים, קודם מתמללים את קובץ הקול לטקסט, ורק בקריאה שנייה מפעילים את מודל השפה כדי להגיב, לתמצת או לענות על שאלות. אם שולחים אליו פרומפט טקסטואלי בלבד ללא שמע, הוא מתפקד כמודל טקסט רגיל לכל דבר.

הוא מאומן לתמלל ולתרגם חמש שפות מרכזיות: אנגלית, צרפתית, גרמנית, ספרדית ופורטוגזית, לצד תרגום מאנגלית ליפנית ולמנדרינית. בגרסה הנוכחית העמיקו את מקודד השמע והוסיפו עשרות אלפי שעות אימון ממאגרי מידע ציבוריים וסינתטיים, מה שמשפר את רמת הדיוק בתמלול אנגלית לעומת הגרסה הקודמת.

מתאים ל

  • תמלול שיחות באנגלית ואירופאיות

    הוא אומן על עשרות אלפי שעות דיבור רב לשוני ומספק תמלול ישיר לקבצים.

  • תרגום קולי מאנגלית לשפות נוספות

    הוא מתרגם דיבור ישירות לגרמנית, ספרדית, צרפתית, פורטוגזית, יפנית ומנדרינית.

  • שאלות ותשובות על הקלטות בשני שלבים

    מפענח את השמע לטקסט ואז מריץ את מודל ההוראות המובנה כדי לענות על התוכן.

איפה זה נופל

אין כאן שום תמיכה בעברית, לא לתמלול ולא לתרגום קולי. ניסיון להזין הקלטה בעברית פשוט לא יעבוד. בנוסף, הארכיטקטורה מחייבת שתי קריאות נפרדות כדי לקבל מענה על שמע ולא קריאה אחת רציפה, מה שמוסיף השהיה. מודלים קטנים בסדרי גודל כאלה עדיין מועדים להזיות בתשובות, וכשהקלט השמע אינו תקין או מוכר, המודל נוטה פשוט לחזור על התמלול שלו במקום לעבד אותו.

אותה משפחה

granite-speech-3.3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ומתמלל שיחות בעברית?

לא. המודל אומן ותומך באופן רשמי אך ורק באנגלית, צרפתית, גרמנית, ספרדית ופורטוגזית, ותרגום ליפנית ומנדרינית. אין להשתמש בו לקבצי שמע בעברית.

למה צריך לבצע שתי קריאות נפרדות כדי לקבל תשובה על קובץ קול?

הארכיטקטורה לא מייצרת תשובה ישירה מהאודיו. הקריאה הראשונה מתמללת את הדיבור לטקסט, והקריאה השנייה מעבירה את הטקסט למודל השפה granite-3.3-8b-instruct כדי לעבד את הבקשה.

איך מריצים

המשקל הכולל של הקבצים עומד על 16.2 גיגה בייט בדיוק bfloat16, כך שכדי לטעון אותו לזיכרון כרטיס המסך תצטרכו לפחות עשרים גיגה בייט של זיכרון ייעודי, ועוד מרווח נאה לטוקנים ולעיבוד השמע. הרצה מקומית דורשת תמיכה בספריית transformers מגרסה 4.52.4 ומעלה יחד עם torchaudio ו־peft, או שימוש במנוע vLLM שנתמך במצב מקוון או לא מקוון.

אם אין לכם כרטיס גרפי מתאים להרצה של קבצים בגודל כזה, הקמה של שרת ייעודי תהיה יקרה וכבדה, ועדיף להשתמש בפתרון מרוחק דרך ממשק חיצוני ולא להחזיק שרת דולק סביב השעון.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="ibm-granite/granite-speech-3.3-8b")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של קוד המקור, הפצה ושילוב בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי חבות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗