GPT
G

GigaAM-Multilingual

קוד פתוח

ai-sagemit2026-07-14

  • pytorch
  • gigaam
  • automatic-speech-recognition
  • custom_code
  • ru

מודל תמלול קומפקטי שמביס מתחרים כבדים ברוסית, קזחית, קירגיזית ואוזבקית. הוא שוקל פחות מג'יגה ומכוון למי שצריך תמלול מדויק בשפות האלו בלי להחזיק שרת יקר.

  • 842 MBמשקל הקבצים
  • 174,865הורדות בחודש
  • 84לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Conformer, שאומן מראש על שני מיליון שעות דיבור ביותר מ־70 שפות ועבר כוונון ייעודי לתמלול עם מפענח CTC. יש לו שתי רמות גודל עיקריות, 220 מיליון ו־600 מיליון פרמטרים, כאשר המשקל להורדה בגרסה הבסיסית עומד על 842 מגה-בייט בלבד.

במבחני הביצועים הוא מציג יתרון ברור על פני כלים כמו Whisper large v3 בשפות של מרכז אסיה וברוסית. ברוסית גרסת ה־Large מגיעה לשיעור שגיאות של 3% ב־FLEURS לעומת 3.1% של וויספר, ובאוזבקית הוא מגיע ל־7.3% לעומת קריסה מוחלטת של וויספר עם מעל 100% שגיאות. באנגלית, לעומת זאת, התוצאות בינוניות למדי והוא מפסיד למודלים הגדולים של מטא ו־OpenAI.

מתאים ל

  • תמלול הקלטות ברוסית

    דיוק גבוה מאוד של עד 3% שגיאות במבחנים, עם זמני ריצה מהירים ומשקל מודל קל במיוחד.

  • עיבוד שפות מרכז אסיה

    ביצועים יציבים בקזחית, אוזבקית וקירגיזית, במקומות שבהם מודלים עולמיים אחרים נכשלים לחלוטין.

  • אימון תמלול לשפות נוספות

    שימוש בגרסאות ה־SSL שאומנו על שני מיליון שעות כבסיס יעיל לכוונון על שפות דלות משאבים.

איפה זה נופל

החולשה העיקרית שלו היא השפה האנגלית, שבה הוא רושם 21.5% שגיאות ב־Common Voice בגרסה הגדולה לעומת 16.2% של מודלים אחרים. בנוסף, המבחנים שפורסמו התבצעו רק על קטעים קצרים מחצי דקה שנוקו מסימני פיסוק, אותיות גדולות ומספרים, כך שבמציאות תצטרכו לדאוג בעצמכם לניקוי הטקסט ולחלוקת הקלט. מעבר לזה, רשימת השפות הנתמכות לתמלול מוכן מצומצמת מאוד, וכל שפה אחרת תדרוש אימון נוסף מאפס.

שאלות
נפוצות

האם המודל יודע לתמלל בעברית?

המודל המוכן מגיע מאומן לתמלול ישיר רק ברוסית, אנגלית, קזחית, קירגיזית ואוזבקית. אפשר להשתמש בשכבת הקידוד שלו כדי לאמן מודל לעברית, אבל זה דורש תהליך כוונון עצמאי על הקלטות מתויגות.

מה ההבדל בין גרסאות ה־ssl לגרסאות ה־ctc?

גרסאות ה־ctc כוללות מפענח מוכן שפולט טקסט ישירות מקובץ השמע. גרסאות ה־ssl מכילות רק את המקודד שמייצר ייצוג וקטורי של הקול, והן מיועדות בעיקר למי שרוצה לאמן מפענח משלו על שפה חדשה.

איך מריצים

טוענים את המודל דרך transformers עם האפשרות trust_remote_code מופעלת, ובוחרים את הגרסה הרצויה לפי ה־revision המתאים, כמו ctc לתמלול ישיר או ssl אם רוצים רק את שכבת הקידוד. גרסת ה־220 מיליון פרמטרים קלה מאוד ותרוץ בלי בעיה גם על כרטיס מסך פשוט או על מעבד סטנדרטי בלי לדרוש משאבי ענן כבדים.

אם כל מה שאתם צריכים זה תמלול באנגלית, אין טעם להריץ אותו בעצמכם ועדיף להישאר עם שירותים קיימים. הפעלת המודל בעצמכם משתלמת ברגע שאתם מעבדים נפחים גדולים של אודיו ברוסית או בשפות אזוריות של ברית המועצות לשעבר ורוצים ביצועים מהירים בעלות שרתים מינימלית.

pip install -U huggingface_hub
hf download ai-sage/GigaAM-Multilingual

הקבצים

5 קבצים במאגר, 842 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פרטיים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗