GPT
G

granite-speech-4.1-2b

קוד פתוח

ibm-graniteapache-2.02026-04-16

  • transformers
  • safetensors
  • granite_speech
  • automatic-speech-recognition
  • multilingual

מודל תמלול ותרגום קולי קומפקטי שנשען על מודל שפה קטן. הוא מתאים למי שרוצה להריץ זיהוי דיבור עצמאי מקומית וצריך דיוק בשמות מקצועיים דרך רשימות מילים ייעודיות.

  • 2.3Bפרמטרים
  • 4,096טוקנים בהקשר
  • 4.5 GBמשקל הקבצים
  • 358,499הורדות בחודש

מה זה

הארכיטקטורה מחברת מקודד קול מבוסס קונפורמר עם מודל שפה של מיליארד פרמטרים ממשפחת גרניט, לסך של כמעט שניים נקודה שלושה מיליארד פרמטרים. האימון כלל מאה שבעים וארבע אלף שעות שמע ומיועד לתמלול ותרגום קולי ישיר. הוא תומך באנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית ויפנית, לצד תרגום קולי מאנגלית לאיטלקית ומנדרינית.

הייחוד כאן לעומת מערכות זיהוי דיבור קלאסיות הוא השילוב של מודל שפה שמטפל ישירות בפיסוק ואותיות גדולות לפי פרומפט, בלי צורך במודל ניקוי נפרד. במבחני פיסוק באנגלית שיעור השגיאות שלו נע סביב תשעה עד עשרים וחמישה אחוזים, ובגרמנית הוא הציג ציון דיוק של מעל תשעים ותשעה אחוזים בהתמודדות עם שמות עצם. יתרון מעשי נוסף הוא תמיכה מובנית ברשימות מונחים ספציפיים שהמשתמש מעביר בפרומפט, מה שמשפר זיהוי ראשי תיבות וסלנג טכני.

מתאים ל

  • תמלול שיחות טכניות

    זיהוי שמות מוצרים ומונחים מקצועיים באנגלית בעזרת רשימות מילים ייעודיות שמועברות בפרומפט.

  • תרגום קולי אוטומטי

    המרת דיבור משפות אירופיות או יפנית ישירות לטקסט מתורגם באנגלית, בלי מערכת תרגום נפרדת.

  • שרת תמלול פנימי בארגון

    הרצה מקומית על כרטיס גרפי זול עם תמיכה מלאה בווי אל אל אם ושמירה על פרטיות המידע.

איפה זה נופל

עברית לא נתמכת כאן בכלל. אם תזינו שמע בעברית המודל פשוט ייכשל או ינסה למפות צלילים לשפות שהוא מכיר. הגרסה הבסיסית הזו גם לא מחזירה חותמות זמן ברמת המילה ולא מזהה איזה דובר אמר מה, תכונות קריטיות להקלטת פגישות שדורשות מעבר לגרסת הפלוס.

מפתחי המודל מציינים במפורש שחלון ההקשר עומד על ארבעת אלפים טוקנים, ושמודלים בגודל הזה מועדים להזיות כשמבקשים מהם משימות יצירתיות. במקרים של פרומפט שבור או לא מוכר המודל פשוט נופל לתמלול רגיל כדי למנוע התנהגות לא צפויה, מה שאומר שאי אפשר להסתמך עליו לפקודות שמע מורכבות מעבר להוראות הכתובות בדוקומנטציה.

שאלות
נפוצות

האם המודל יודע לתמלל הקלטות בעברית?

לא. המודל מאומן רק על אנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית ויפנית, ואין לו תמיכה רשמית בעברית. שימוש בהקלטה עברית ייצר פלט שגוי או ג׳יבריש.

האם מקבלים זיהוי דוברים וזמנים לכל מילה?

לא בגרסה הזו. המודל הנוכחי מוציא טקסט רציף בלבד, וכדי לקבל חלוקה לדוברים וחותמות זמן תצטרכו להוריד את גרסת הפלוס של הפרויקט.

איך משפרים זיהוי של מונחים וסלנג ספציפי?

אפשר להעביר רשימת מונחים באנגלית כחלק מההנחיה למודל בזמן הקריאה. המנגנון הפנימי מקבל עדיפות לאותם ביטויים ומשפר את הסיכוי שהם יופיעו במדויק בתמליל.

איך מריצים

במשקל של ארבעה וחצי גיגה בייט, אפשר להריץ אותו בלי מאמץ על כרטיס גרפי ביתי פשוט עם שמונה גיגה זיכרון, או על מחשבי מק עם שבבי אפל באמצעות ספריית אמ אל איקס או לאמה סי פי פי בקוונטיזציה. הוא נתמך ישירות בטרנספורמרס ובווי אל אל אם, כך שקל לשלב אותו בשרת קיים לצד מודלי טקסט אחרים.

אם אתם צריכים רק תמלול נקודתי בלי שמות מסובכים או התאמות, עדיף להשתמש בממשק מנוהל חיצוני ולחסוך תחזוקת שרתים. יש למשפחה שתי גרסאות נוספות שלא כדאי להתעלם מהן, גרסת פלוס שמוסיפה זיהוי דוברים וחותמות זמן ברמת המילה, וגרסה לא אוטורגרסיבית שמיועדת לקצב עיבוד גבוה במיוחד.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="ibm-granite/granite-speech-4.1-2b")
print(pipe("שלום"))

הקבצים

29 קבצים במאגר, 4.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ׳י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי תמלוגים ובלי חובת שיתוף של הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗