GPT
M

MOSS-Transcribe-Diarize

קוד פתוח

OpenMOSS-Teamapache-2.02026-05-19

  • transformers
  • safetensors
  • moss_transcribe_diarize
  • text-generation
  • moss

הוא מתמלל ומפריד דוברים במעבר יחיד במקום בשרשור כלים נפרדים. בחירה טובה אם אתם צריכים זיהוי דוברים מקומי וזול בלי לשלם לעננים לפי דקה.

  • 909Mפרמטרים
  • 131,072טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 251,069הורדות בחודש

מה זה

במקום להריץ Whisper ואז להדביק מעליו מנוע הפרדת דוברים כמו PyAnnote, המודל הזה תוכנן מראש לעשות את שתי הפעולות יחד. הוא מקבל קובץ קול או וידאו באורך של עד 90 דקות ופולט ישירות טקסט רציף עם חותמות זמן ושיוך לדוברים אנונימיים כמו S01 או S02. הוא כולל תמיכה באירועים קוליים ומאפשר להזריק מילות מפתח מראש כדי לשפר דיוק בשמות ומונחים מקצועיים.

במבחני ההשוואה שמפורסמים בדף שלו הוא מציג שגיאות נמוכות מול מודלים ענקיים כמו ג'מיני וכלים ייעודיים ברשת. מדד השגיאה המשוקלל שלו נשאר יציב גם בשיחות מרובות משתתפים ופודקאסטים, מה שאומר שהוא כמעט לא מתבלבל בסדר הדוברים או מחליף ביניהם כשהם מדברים יחד.

מתאים ל

  • תמלול פגישות עבודה

    מזהה חילופי דוברים עד 90 דקות במעבר אחד בלי לתאם בין כמה מודלים נפרדים.

  • יצירת כתוביות לשידורים

    כולל ממשק מובנה שמייצא קובצי כתוביות ישר עם תזמונים והפרדה לדוברים.

  • ניתוח ראיונות ופודקאסטים

    מאפשר להגדיר מילות מפתח ייחודיות כדי לשמור על שמות מדויקים בשיחות עמוסות.

איפה זה נופל

הכרטיס מציג תמיכה רחבה בעשרות שפות, אבל המטא נתונים הרשמיים מגדירים בעיקר אנגלית וסינית, ואין פירוט על איכות התוצאה בעברית. ברירת המחדל של ההנחיות וממשק המשתמש נשענים בכבדות על סינית, כך שצריך לכוונן את הפרומפט כדי לא לקבל פלט מעורב. בנוסף, חובה להפעיל הרצת קוד מרוחק בטעינה, מה שדורש בדיקת אבטחה של הקבצים לפני הרצה בסביבת ייצור, ובקבצים ארוכים עם כמה דוברים מוכרחים להגדיר ידנית תקרת טוקנים גבוהה כדי שהתמלול לא ייחתך באמצע.

שאלות
נפוצות

האם הוא מתאים לשימוש בתמלול הקלטות בעברית?

הכרטיס מציין תמיכה בלמעלה מחמישים שפות והתמודדות בתחרויות רב לשוניות, אבל תגיות השפה המרכזיות הן אנגלית וסינית בלבד. אין נתוני מדידה רשמיים לגבי עברית. תצטרכו להריץ עליו דגימת קול מקומית ולבדוק אם הוא בכלל מזהה את המילים ואת המבטא לפני שאתם בונים עליו תהליך עבודה.

האם אני צריך מנוע נפרד כדי לדעת מי דיבר ומתי?

לא, וזה היתרון המרכזי כאן. הוא מוציא את הטקסט יחד עם חותמת זמן מדויקת ותווית דובר כמו S01 או S02 באותה פעולה בדיוק. אין צורך להעביר את ההקלטה תהליך נוסף של חיתוך וזיהוי קולות.

איך מריצים

המשקל הכולל יושב על 1.7 גיגה בייט בלבד עם פחות ממיליארד פרמטרים, מה שאומר שכרטיס מסך בסיסי עם 8 או 12 גיגה זיכרון יריץ אותו בלי בעיה. אפשר להעלות אותו ישירות בסביבת פייתון מקומית, אבל לשימוש רציני עדיף להרים אותו מעל vLLM או SGLang Omni, שמספקים ממשק תואם OpenAI עם נקודת קצה של תמלול.

אין פה גרסאות מקומיות מרובות לבחור ביניהן, אבל המפתחים מציעים גם גרסת פרו בענן שלהם שהציגה תוצאות מדויקות יותר. אם יש לכם קבצים של כמה שעות בודדות בחודש ואין לכם שרת ייעודי שפועל ממילא, להחזיק תשתית עצמאית בשבילו יהיה מיותר ויקר יותר משימוש בנקודת קצה חיצונית.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="OpenMOSS-Team/MOSS-Transcribe-Diarize")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗