GPT
G

granite-speech-4.1-2b-nar

קוד פתוח

ibm-graniteapache-2.02026-03-10

  • transformers
  • safetensors
  • granite_speech_nar
  • feature-extraction
  • speech

תמלול דיבור מהיר במיוחד שמבוסס על עריכת טקסט במעבר יחיד במקום יצירת מילים מילה אחרי מילה. מתאים למי שחייב השהיה אפסית באנגלית או בשפות אירופיות מרכזיות.

  • 2.3Bפרמטרים
  • 4,096טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 96,146הורדות בחודש

מה זה

במקום לנחש כל מילה לפי המילה שלפניה כמו במודלים רגילים, הארכיטקטורה הזו עובדת אחרת לגמרי. מקודד Conformer מייצר ניחוש ראשוני גולמי, ומודל שפה דו כיווני של מיליארד פרמטרים מתקן את השגיאות בריצה מקבילית אחת. הרעיון הוא לנצל את היכולת של המודל להעתיק את רוב התוכן ולהתמקד רק בתיקון, הוספה ומחיקה של מה שצריך.

בבדיקות הביצועים של IBM על מעבד H100 יחיד, המודל הגיע לקצב עיבוד של פי 1820 מזמן אמת עם גודל אצווה של 128. מבחינת שגיאות, הוא מגיע ל־1.29 אחוזי WER בטקסטים נקיים של LibriSpeech ול־8.48 אחוזים בהקלטות פיננסיות של Earnings-22, מספרים תחרותיים מאוד לקצב ריצה כזה.

מתאים ל

  • תמלול שיחות בזמן אמת

    מעבר החישוב המקבילי מספק תמלול מיידי כמעט ללא השהיה במוקדי שירות או בעוזרים קוליים באנגלית ובאירופית.

  • עיבוד כמויות שמע בארכיון

    קצב עיבוד של פי 1820 ממהירות השמע מאפשר לרוקן תורי הקלטות ענקיים בעלות חישוב נמוכה מאוד.

  • מערכות עם דרישות פרטיות

    גודל קבצים של 4.2 גיגה בייט מתאים להפעלה על שרת מקומי מבודד בלי לשלוח שום קובץ קול החוצה.

איפה זה נופל

הבעיה המרכזית לישראלים היא היעדר מוחלט של תמיכה בעברית, שכן האימון כולל רק חמש שפות: אנגלית, צרפתית, גרמנית, ספרדית ופורטוגלית. המודל שמרני מאוד ונוטה למחוק מילים במקום להוסיף אותן, מה שמוביל להשמטות ברעש רקע או בדיבור רחוק מהמיקרופון, כפי שרואים בזינוק ל־19.59 אחוזי שגיאה במבחן AMI SDM. בנוסף, הוא לא מייצר סימני פיסוק, לא שומר על אותיות גדולות, ולא יודע לחלץ חותמות זמן או להפריד בין דוברים שונים.

שאלות
נפוצות

האם המודל מזהה עברית או ערבית?

לא. האימון הוגבל מראש לחמש שפות בלבד, שהן אנגלית, צרפתית, גרמנית, ספרדית ופורטוגלית. שפות אחרות לא נתמכות בכלל, ואין טעם לנסות להזין לו קבצי שמע בעברית.

האם הפלט כולל פסיקים, נקודות וזיהוי דוברים?

לא, הגרסה הזו פולטת טקסט גולמי בלבד, בלי פיסוק, בלי אותיות גדולות ובלי שיוך לדובר. כדי לקבל תמלול עם זיהוי דוברים וזמני מילים, החברה ממליצה על גרסת הפלוס האוטו־רגרסיבית שלה.

איך מריצים

הקבצים שוקלים 4.2 גיגה בייט, כך שאפשר להריץ אותו בקלות על מאיץ גרפי פשוט עם 8 עד 12 גיגה זיכרון וידאו, בתנאי שעובדים בפורמט bfloat16. הדרישות הטכניות קשיחות ומחייבות Flash Attention 2, גרסת PyTorch 2.9.1 ומעלה, וספריית transformers בגרסה 5.5.3 ומעלה, כי המודל מסתמך על קשב דו כיווני שאינו סיבתי.

אם יש לכם כרטיס מתאים וסביבת לינוקס מסודרת, הריצה המקומית הגיונית וזולה מאוד. שירות ענן חיצוני עדיף רק אם אין לכם גישה למאיצי אנבידיה מודרניים שתומכים בגרסאות הנדרשות, או כשאין לכם כוונה לתחזק תלויות תוכנה ספציפיות כאלה.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="ibm-granite/granite-speech-4.1-2b-nar")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו, בלי דרישה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗