GPT
G

granite-speech-5.0-470m-turboctc

קוד פתוח

ibm-graniteapache-2.02026-08-04

  • transformers
  • safetensors
  • granite_speech5_ctc
  • automatic-speech-recognition
  • en

מודל תמלול קומפקטי ומהיר במיוחד באנגלית, שמיועד לרוץ מקומית על מחשבים ניידים ומכשירי קצה בלי לפגוע משמעותית בדיוק.

  • 473Mפרמטרים
  • 903 MBמשקל הקבצים
  • 18,514הורדות בחודש
  • 62לייקים

מה זה

מדובר במודל זיהוי דיבור קומפקטי שמבוסס על ארכיטקטורת Conformer עם ראש CTC, שנועד לתמלל שמע ישירות לטקסט בפעולה אחת ללא פענוח רציפי אטי. הוא אומן על כ־60,000 שעות שמע באנגלית ממאגרים ציבוריים כמו MLS ו־Common Voice, לצד תוספות סינתטיות של מספרים, כתובות אתרים וסכומי כסף כדי לשפר תמלול של ישויות מורכבות.

במקום מודלים שמייצרים מילה אחרי מילה ומכבידים על המעבד, הגישה כאן ממוקדת בתפוקה גבוהה וזמן תגובה קצר. במדידות על כרטיסי H200 ו־L4 נבדקו ביצועי התמלול מול רעשי רקע והדהוד, במטרה לתת מענה מהיר במיוחד לשימושים שבהם שרת כבד אינו אופציה סבירה.

מתאים ל

  • תמלול פקודות קוליות בקצה

    הוא קל מספיק כדי לרוץ על מחשבים ניידים ומכשירי קצה בזמן אמת בלי תלות בשרת.

  • עיבוד שיחות שירות באנגלית

    הוא אומן על שיחות מרובות דוברים ומונחים פיננסיים כמו סכומי כסף ומספרים.

  • תמלול מהיר ללא חיבור רשת

    משקלו פחות מג'יגה-בייט, מה שמאפשר להטמיע אותו בתוכנות עצמאיות שפועלות אופליין.

איפה זה נופל

החיסרון המרכזי והברור ביותר עבור מפתח ישראלי הוא היעדר תמיכה בעברית. הוא אומן אך ורק על אנגלית ולא יזהה אף שפה אחרת. בנוסף, המודל נבדק בעיקר על מקטעי דיבור קצרים, כך שבתמלול הקלטות ארוכות ורציפות ללא חלוקה מוקדמת למקטעים הביצועים עלולים להיפגע.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לתמלל שמע בעברית?

לא. המודל תומך באנגלית בלבד ואומן על מאגרי שמע באנגלית, כך שהוא יחזיר ג'יבריש או שגיאות על כל שפה אחרת.

איזו חומרה צריך כדי להריץ אותו בפועל?

המשקל של הקבצים הוא 903 מגה-בייט בלבד, כך שכל מחשב נייד מודרני יכול להריץ אותו על המעבד, ויש לו תמיכה מובנית ב־Apple Silicon דרך mlx-audio.

האם הוא מתאים לשידור חי ודיבור בזמן אמת?

הוא בנוי לעיבוד non-autoregressive מהיר מאוד עם יחס זמן עיבוד קצר, מה שהופך אותו למתאים לתגובה מהירה על מקטעי שמע קצרים.

איך מריצים

המודל שוקל 903 מגה-בייט ורץ ישירות דרך ספריית transformers מגרסה 5.16.0 ומעלה, או באמצעות ספריית mlx-audio למחשבי מק עם מעבדי Apple Silicon. בזכות הגודל הצנוע, אין צורך בשרת ייעודי חזק וכרטיס מסך פשוט או מעבד של מחשב נייד יספיקו כדי לקבל זמני תגובה טובים.

אם אתם צריכים לתמלל שפות שאינן אנגלית, אין מה לנסות להרים אותו באופן מקומי ועדיף לשלוח בקשות ל־API חיצוני שמחזיק מודל רב-לשוני גדול. הרצה עצמית כאן משתלמת רק כשחייבים פרטיות מלאה, עבודה ללא רשת או עיבוד כמויות שמע גדולות באנגלית בלי עלויות ענן.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="ibm-granite/granite-speech-5.0-470m-turboctc")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או ללקוחות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בתוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗