GPT
G

granite-speech-4.1-2b-plus

קוד פתוח

ibm-graniteapache-2.02026-04-16

  • transformers
  • safetensors
  • granite_speech_plus
  • automatic-speech-recognition
  • multilingual

תמלול קול שמשלב זיהוי דוברים וחותמות זמן ברמת המילה דרך פרומפט בודד. הבחירה בו הגיונית בעיקר כשרוצים דיאריזציה וסנכרון מדויק במודל קומפקטי אחד.

  • 2.1Bפרמטרים
  • 4,096טוקנים בהקשר
  • 3.9 GBמשקל הקבצים
  • 119,929הורדות בחודש

מה זה

הגרסה הזו של יבמ לוקחת את מודל הבסיס ומוסיפה לו שתי יכולות שחסרות בדרך כלל במודלים קטנים, שיוך מילים לדוברים שונים וסימון זמנים מדויק ברמת המילה הבודדת. השליטה מתבצעת כולה דרך ניסוח הפרומפט, בלי צורך בראש סיווג נפרד או במודל דיאריזציה חיצוני כבד. הוא תומך באנגלית, צרפתית, גרמנית, ספרדית ופורטוגזית, ומציע גם הזרקת מילות מפתח לפרומפט כדי לשפר זיהוי של מונחים מקצועיים.

בבדיקות השיוך לדוברים הוא השיג 0.9 אחוזי שגיאה במבחן פישר ו־2.2 בשיחות קוליות באנגלית, פער משמעותי מול מודלים מתחרים שהגיעו לשבעה אחוזים ומעלה. בדיוק הזמנים הוא מציג הסטה ממוצעת של 38.8 מילישניות באנגלית ו־29.8 בשפות האחרות. הפשרה המרכזית לעומת גרסת הבסיס היא שהפלט שלו מגיע כטקסט גולמי בלבד, ללא סימני פיסוק וללא אותיות גדולות.

מתאים ל

  • יצירת כתוביות לסרטונים

    חותמות זמן ברמת המילה עם שגיאה ממוצעת של עשרות מילישניות בודדות מאפשרות לחתוך כתוביות בדיוק מושלם לקול.

  • תמלול שיחות תמיכה ומוקד

    המודל מפריד בין נציג ללקוח לפי סדר הדיבור שלהם וחוסך הרצה של מנוע דיאריזציה ייעודי וכבד.

  • אינדוקס שמע מרובה מונחים

    יכולת הזרקת מילות מפתח לפרומפט מקפיצה את הדיוק במונחים טכניים ושמות מוצרים שנוטים להשתבש.

איפה זה נופל

עברית לא נתמכת כאן כלל. מי שינסה להזין הקלטה בעברית יקבל ג'יבריש או הזיות. החיסרון המהותי השני הוא אובדן מוחלט של פיסוק ואותיות גדולות, מה שמחייב מודל שפה נוסף בשרשרת אם הטקסט מיועד לקריאה אנושית.

מעבר לכך, המודל עובד טוב רק על מקטעים של עד תשע דקות לתמלול ודוברים, ועד שלוש וחצי דקות לחותמות זמן. חותמות הזמן עצמן מתאפסות כל עשר שניות, כך שחובה לכתוב קוד עוטף שמחשב את היסט הזמן כדי לקבל שניות אמיתיות.

שאלות
נפוצות

האם המודל יודע לתמלל עברית?

לא. רשימת השפות כוללת רק אנגלית, צרפתית, גרמנית, ספרדית ופורטוגזית. הוא לא מאומן על עברית ולא מיועד לכך.

למה הטקסט יוצא בלי נקודות ובלי אותיות גדולות?

התוספת של זיהוי דוברים וזמנים אילצה את היוצרים לוותר על פיסוק ואותיות גדולות בארכיטקטורה הזו. כדי לקבל טקסט מעוצב לקריאה תצטרכו להעביר את הפלט דרך מודל תיקון טקסט נפרד, או לעבור לגרסת הבסיס אם אתם לא צריכים זמנים.

איך מחשבים את הזמן האמיתי של כל מילה?

הערכים בפלט ניתנים במאיות שנייה ומתאפסים בכל עשר שניות. תצטרכו לזהות בקוד מתי המספר קטן מהמספר הקודם, להוסיף עשר שניות למונה ההיסט, ולחלק במאה כדי לקבל תוצאה מדויקת בשניות.

איך מריצים

המשקל עומד על 3.9 גיגה בייט, כך שכרטיס מסך בודד עם 8 עד 12 גיגה זיכרון יריץ אותו בקלות בסביבת פייתון. הוא נתמך בספריית טרנספורמרס מגרסה 5.8 וגם במנוע vLLM מגרסה 0.23.0 ומעלה, שמתאים לפריסה בייצור עם תפוקה גבוהה.

אם כל מה שאתם צריכים זה תמלול טקסט נקי וקריא עם אותיות גדולות ופיסוק, גרסת הבסיס הרגילה עדיפה, ואם נדרש קצב עיבוד מקסימלי לטקסט בלבד שווה לבדוק את גרסת ה־NAR. להריץ אותו עצמאית שווה רק אם אתם צריכים את חותמות הזמן והדוברים בתוך תשתית פרטית, אחרת קריאה ל־API תחסוך את פענוח הזמנים שדורש לוגיקה נוספת בקוד.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="ibm-granite/granite-speech-4.1-2b-plus")
print(pipe("שלום"))

הרישיון

רישיון אפאצ'י 2.0 מלא. אפשר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור בלי לשלם תמלוגים, בתנאי ששומרים על הצהרת זכויות היוצרים של המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗