GPT
G

granite-4.0-1b-speech

קוד פתוח

ibm-graniteapache-2.02026-02-27

  • transformers
  • safetensors
  • granite_speech
  • automatic-speech-recognition
  • multilingual

מודל תמלול ותרגום דיבור קל משקל של יבמ, שמחבר מקודד שמע לרשת שפה. הוא מיועד למי שחייב מהירות גבוהה ומשאבים נמוכים בלי לוותר על דיוק באנגלית.

  • 2.3Bפרמטרים
  • 4,096טוקנים בהקשר
  • 4.3 GBמשקל הקבצים
  • 24,880הורדות בחודש

מה זה

המודל מחבר מקודד שמע מסוג Conformer עם מודל שפה קטן מסוג granite-4.0-1b-base, ומציע תמלול وترגום דיבור דו-כיווני בשש שפות עיקריות: אנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית ויפנית. בנוסף הוא תומך בתרגום מאנגלית לאיטלקית ולמנדרינית. הייחוד שלו לעומת גרסאות קודמות בסדרה הוא צמצום משמעותי במשאבים יחד עם תמיכה בהזנת רשימת מילות מפתח מראש, תכונה שעוזרת לו לתפוס שמות פרטיים וראשי תיבות שבדרך כלל נבלעים במודלים קטנים.

בבדיקות פומביות בלוח המבחנים של HuggingFace הוא רושם ממוצע שגיאות מילים של 5.52 אחוזים וציון מהירות מרשים של 280.02. המשמעות בפועל היא שהוא מתמלל הקלטות בקצב גבוה בהרבה מזמן אמת, כשהדיוק שלו נשאר גבוה מאוד בהקלטות נקיות כמו ליבריספיץ עם 1.42 אחוזי שגיאה, ויורד באודיו מורכב כמו פודקאסטים של גיגהספיץ לאזור ה־10.14 אחוזים.

מתאים ל

  • תמלול פגישות באנגלית

    מאפשר להכניס שמות משתתפים ומונחים טכניים ברשימת מילים כדי למנוע טעויות תמלול נפוצות.

  • תרגום שיחות בזמן אמת

    תרגום דיבור ישיר בין אנגלית לשפות אירופיות או יפנית, שמתאים למערכות שירות לקוחות.

  • הרצה מקומית על מחשבי מק

    התאמה מובנית ל־mlx-audio מאפשרת לעבד אודיו ישירות על חומרת אפל סיליקון בלי ענן.

איפה זה נופל

הנקודה הקריטית ביותר לקורא המקומי היא היעדר מוחלט של עברית. המודל כלל לא אומן עליה, ולכן הוא חסר תועלת לחלוטין לתמלול הקלטות בשפה שלנו. מעבר לכך, היוצרים מודים שמודלים מוקטנים מועדים יותר להזיות וליצירת טקסט לא מדויק בהשוואה למודלי ענק. במצבים של פרומפט שבור או קלט בעייתי הוא פשוט נופל לתמלול עיוור ומתעלם מההוראות.

שאלות
נפוצות

האם המודל תומך בתמלול הקלטות בעברית?

לא. המודל אומן רק על אנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית ויפנית, ולא יזהה דיבור בעברית כלל.

איך אפשר לשפר זיהוי של מונחים מקצועיים?

אפשר להזין למודל רשימת מילות מפתח מראש לפני התמלול. המנגנון הזה מכוון את הרשת להעדיף שמות ומונחים נדירים.

מה נדרש כדי להריץ אותו במחשב מקומי?

סביבת פייתון פשוטה עם ספריית transformers עדכנית וכרטיס מסך בסיסי עם לפחות 6 גיגה-בייט של זיכרון.

איך מריצים

המודל דורש כ־4.3 גיגה-בייט של זיכרון בלבד בגרסת bfloat16 מלאה, מה שאומר שכרטיס מסך ביתי פשוט עם 6 עד 8 גיגה-בייט VRAM יספיק כדי להריץ אותו בלי בעיה. הוא נתמך ישירות בספריית transformers הרגילה, עובד בתשתית vLLM לעיבוד שרתים מהיר, וכולל מימוש ייעודי ב־mlx-audio עבור מחשבי אפל עם מעבדי M, כולל גרסאות מכווצות ל־8 ביט.

אם אתם צריכים תמלול שוטף בארגון מקומי או על מכשירי קצה, שווה לחלוטין להרים אותו לבד כי עלות החומרה אפסית והתפוקה שלו מהירה מאוד. שימוש בשירות חיצוני עדיף רק אם אתם לא רוצים לנהל שרתים בכלל או אם נפח השימוש שלכם הוא כמה הקלטות בודדות בחודש.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="ibm-granite/granite-4.0-1b-speech")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗