GPT
G

GLM-ASR-Nano-2512

קוד פתוח

zai-orgmit2025-12-09

  • transformers
  • safetensors
  • glmasr
  • text2text-generation
  • automatic-speech-recognition

תמלול קול שמתמקד באנגלית, מנדרינית ודיאלקטים כמו קנטונזית. הוא בנוי להתמודד עם דיבור חלש במיוחד ומביא דיוק תחרותי במשקל של כ־4.2 גיגה־בייט.

  • 2.3Bפרמטרים
  • 8,192טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 57,450הורדות בחודש

מה זה

המודל מיועד לזיהוי דיבור באנגלית ובסינית, עם דגש מיוחד על דיאלקטים כמו קנטונזית ועל הקלטות שקשה לפענח. המפתחים אימנו אותו ספציפית לזהות לחישות ודיבור בווליום נמוך, אזור שבו מודלים רגילים נוטים לפספס מילים או להמציא טקסט.

לפי כרטיס המודל, הוא מציג שיעור שגיאה ממוצע של 4.10 במבחני השוואה מול מודלים פתוחים מקבילים, כולל תוצאות טובות על מבחני פגישות מציאותיות כמו Wenet Meeting שכוללים רעשי רקע ודיבור חופף. המשמעות בפועל היא שהוא עובד טוב יותר בהקלטות מלוכלכות מהשטח, לפחות כל עוד מדובר בשפות שהוא מכיר.

מתאים ל

  • תמלול הקלטות שקטות באנגלית

    הוא אומן לתפוס לחישות ודיבור חלש שנוטים להיעלם במודלים אחרים.

  • פענוח דיאלקטים בסינית

    הוא מציג התאמה מיוחדת לקנטונזית ומנדרינית במבחני שמע מאתגרים.

  • תמלול פגישות רועשות

    תוצאות הבנצ'מרק מעידות על עמידות גבוהה יחסית לרעשי רקע ודיבור חופף.

איפה זה נופל

המודל תומך רק באנגלית ובסינית. אין בו שום תמיכה בעברית, ולכן למוצר ישראלי שמכוון לשוק המקומי הוא פשוט לא רלוונטי. בנוסף, ההתקנה דורשת כרגע גרסת פיתוח של transformers ישירות מ־GitHub, מה שעלול ליצור בעיות יציבות ותאימות בסביבת ייצור עד שיתווסף לו גיבוי מסודר בספריות הרצה כמו vLLM.

שאלות
נפוצות

האם אפשר לתמלל איתו הקלטות בעברית?

לא. המודל אומן ותומך רשמית רק באנגלית ובסינית, ואין לו יכולת לזהות עברית.

איזה כרטיס מסך צריך בשביל להריץ אותו מקומית?

הקבצים שוקלים 4.2 גיגה־בייט ויש לו 2.3 מיליארד פרמטרים. כרטיס מסך עם 8 עד 12 גיגה זיכרון וידאו יספיק לתהליך העבודה.

איך מריצים

כדי להריץ אותו צריך ספריית transformers ישירות מ־GitHub, וטוענים את המשקלים דרך GlmAsrForConditionalGeneration עם חלון הקשר של 8,192 טוקנים. המשקל שלו הוא 4.2 גיגה־בייט, כך שכרטיס מסך בסיסי עם 8 עד 12 גיגה זיכרון יחזיק אותו בקלות בלי צורך בשרתים מנופחים.

אם אתם צריכים לתמלל רק שמע סטנדרטי באנגלית בכמויות קטנות, כנראה שפתרון ענן קיים יהיה פשוט יותר לתחזוקה. הרצה עצמית שווה את המאמץ אם יש לכם נפח גדול של שמע בווליום חלש, או צורך בתמלול סינית שלא תלוי בשירותים חיצוניים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="zai-org/GLM-ASR-Nano-2512")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗