GPT
G

granite-speech-3.3-2b

קוד פתוח

ibm-graniteapache-2.02025-04-28

  • transformers
  • safetensors
  • granite_speech
  • automatic-speech-recognition
  • multilingual

מודל תמלול ותרגום דיבור קל משקל של IBM שמבוסס על מודל שפה של 2B פרמטרים. הוא מיועד למי שצריך לפענח אודיו ישירות לתוך הקשר טקסטואלי ארוך בלי לסחוב משקלים כבדים.

  • 3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 11.0 GBמשקל הקבצים
  • 76,758הורדות בחודש

מה זה

המודל בנוי משילוב של מקודד אודיו מבוסס Conformer עם מודל השפה granite-3.3-2b-instruct. הוא מטפל בתמלול אודיו (ASR) ובתרגום דיבור (AST) באנגלית, צרפתית, גרמנית, ספרדית ופורטוגזית, לצד תרגום מאנגלית ליפנית ולמנדרינית. אם שולחים אליו טקסט ללא אודיו, הוא מתפקד כמודל שפה רגיל לגמרי.

הייחוד כאן הוא ארכיטקטורת שני שלבים מפורשת. המודל קודם כל מתמלל את קובץ האודיו לטקסט, ורק בקריאה שנייה נפרדת אפשר להעביר את הטקסט למודל השפה לעיבוד נוסף. זה שונה ממודלים שמשלבים אודיו וטקסט במעבר יחיד, ומונע מהאודיו להשפיע ישירות על שיקול הדעת של מודל השפה.

מתאים ל

  • תמלול שיחות באנגלית

    מתאים לשרת פנימי שמתמלל הקלטות פגישות או שיחות שירות בשפות אירופיות נתמכות ללא תלות ברשת חיצונית.

  • תרגום קולי מאנגלית

    תרגום ישיר של קבצי קול מאנגלית ליפנית או מנדרינית כחלק מתהליך לוקליזציה של תוכן מוקלט.

  • עוזר קולי מאובטח

    ארכיטקטורת שני השלבים מבודדת את האודיו מהפקודות הטקסטואליות ומונעת מתקפות הזרקת פקודות דרך קול.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא היעדר מוחלט של תמיכה בעברית. המודל אומן על אנגלית וכמה שפות אירופיות בלבד, כך שלא תוכלו לתמלל איתו שיחות מקומיות. מעבר לזה, הכרטיס מציין במפורש שמודלים בגודל כזה רגישים להזיות בניסוח טקסט. התכנון של שתי קריאות נפרדות מחייב אתכם לבנות לוגיקה שמנהלת שני צעדים במקום לקבל תשובה ישירה מקובץ קול.

אותה משפחה

granite-speech-3.3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול שיחות בעברית?

לא. המודל תומך באנגלית, צרפתית, גרמנית, ספרדית ופורטוגזית בלבד. ניסיון להזין אודיו בעברית יפיק שגיאות או תמלול חסר משמעות לחלוטין.

למה צריך שתי קריאות נפרדות כדי לקבל תשובה על קובץ קול?

המודל מפריד בכוונה בין זיהוי הדיבור לבין עיבוד השפה. הקריאה הראשונה מחלצת טקסט בלבד, והקריאה השנייה מפעילה את מודל השפה על הטקסט, כדי לצמצם הזרקות קוד וטעויות שמקורן באודיו לא תקין.

כמה זיכרון GPU דרוש כדי להריץ את המודל ביציבות?

המודל שוקל 11GB בדיוק המקורי, ולכן כרטיס מסך עם 16GB זיכרון יספיק לתמלול בסיסי. לעומסי עבודה כבדים עם קבצי אודיו ארוכים ב־vLLM עדיף להשתמש ב־24GB כדי לא להיחנק במגבלת הזיכרון.

איך מריצים

המשקל הכולל יושב על 11 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך בודד עם 16GB זיכרון כמו RTX 4080 או מקביל בענן מספיק להרצה מקומית. אפשר להריץ אותו עם ספריית transformers או דרך vLLM במצב אופליין ואונליין, מה שמקל על הכנסה לשרת קיים.

אם כל מה שאתם צריכים זה תמלול נקי באנגלית בלי לגעת במודל השפה, שירותי API ייעודיים כמו Whisper יהיו פשוטים יותר לתחזוקה. המודל הזה שווה את הטרחה רק אם אתם רוצים את כל הצינור בתוך השרת שלכם או מתכננים לעבד את הטקסט מיד עם מודל ה־2B המובנה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="ibm-granite/granite-speech-3.3-2b")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים משוחררים תחת רישיון Apache 2.0. מותר להשתמש במודל למוצרים מסחריים, לשנות אותו, להריץ אותו בענן פרטי ולהפיץ נגזרות שלו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗