GPT
M

midashenglm-7b-0804-fp32

קוד פתוח

mispeechapache-2.02025-06-26

  • safetensors
  • midashenglm
  • multimodal
  • audio-language-model
  • audio

מודל שמקשיב לקובצי קול ומייצר מהם תיאור מילולי מדויק או עונה על שאלות לגביהם. הוא מתאים למי שצריך תיוג אוטומטי של סביבות שמע ומוזיקה ולא רק תמלול דיבור.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 30.9 GBמשקל הקבצים
  • 13,324הורדות בחודש

מה זה

המודל פותח על ידי צוות בשיאומי במטרה להבין אודיו בצורה מקיפה דרך יצירת כתוביות ותיאורים. הוא מתמודד עם מוזיקה, רעשי רקע וסביבה, ומנתח מאפיינים קוליים כמו זיהוי דוברים או סוג הרעש. בבדיקות כתוביות אודיו כמו MusicCaps ו־AutoACD הוא עוקף מודלים מקבילים כמו Qwen2.5-Omni-7B בפער ניכר, ומפגין דיוק גבוה מאוד בזיהוי סצנות קוליות.

הוא כולל ארכיטקטורה של 8.3 מיליארד פרמטרים עם חלון הקשר של 32,768 טוקנים. החוזק האמיתי שלו נמצא בהבנה של מה שקורה בהקלטה מעבר למילים שנאמרות, תחום שבו מודלים ייעודיים לתמלול מתקשים לעיתים קרובות.

מתאים ל

  • תיוג ספריות מוזיקה ואפקטים

    חילוץ תיאור טקסטואלי מלא של כלי נגינה, סגנונות וסוגי רעשים ישירות מקובצי שמע.

  • ניתוח אירועים והתרעות קול

    זיהוי רעשי רקע וסביבה חריגים בהקלטות קוליות בדיוק שמגיע ליותר מ־70% בבנצ'מרקים.

  • מענה לשאלות על קטעי אודיו

    תשאול חופשי באנגלית על תוכן ההקלטה וקבלת תשובות ישירות על מה שמתרחש בה.

איפה זה נופל

המודל הזה לא נועד להיות מתמלל ראשי. בבדיקות תמלול נקיות באנגלית ובסינית, שיעורי השגיאות שלו ב־LibriSpeech ו־AISHELL2 נחותים מאלה של Qwen2.5 ו־Kimi. בנוסף, אין לו תמיכה רשמית בעברית, כך שכל ניסיון לתמלל או לתשאל אותו בעברית ידרוש בדיקה ידנית של רמת ההזיה. נקודה נוספת היא הדרישה להרצת קוד מרוחק בטעינה, מה שמחייב בדיקת אבטחה של הקוד לפני הפעלה בסביבה סגורה.

שאלות
נפוצות

למה להעדיף את גרסת ה־BF16 על פני ה־FP32?

גרסת ה־FP32 שוקלת 30.9 גיגה-בייט ודורשת חומרה יקרה וכבדה בלי לתת יתרון מעשי באיכות. היוצרים מצהירים שהיא נועדה רק לשחזור מחקרי מדויק, ולכל שאר השימושים מומלץ להוריד את BF16 שרצה מהר יותר ותופסת חצי מנפח הזיכרון.

האם המודל מתאים לתמלול שיחות בעברית?

המודל מוגדר רשמית עבור אנגלית, סינית, תאילנדית, אינדונזית ווייטנאמית, ועברית אינה ברשימה. מעבר לכך, במשימות תמלול נטו הוא מציג ביצועים פחות טובים ממתחרים אחרים בגודל שלו, ולכן עדיף להשתמש במודל תמלול ייעודי.

איך מריצים

המשקל של הגרסה הזו עומד על כמעט 31 גיגה-בייט כי היא שמורה בפורמט float32 מלא. בשביל להעלות אותה לזיכרון תצטרכו כרטיס מסך עם לפחות 40 עד 48 גיגה-בייט VRAM, למשל A100 או זוג כרטיסים חזקים.

היוצרים עצמם ממליצים במפורש לא להשתמש בגרסה הזו למוצרים רגילים אלא להוריד את גרסת ה־BF16, שצורכת חצי מהזיכרון ומספקת ביצועים זהים. שימוש ב־FP32 הגיוני רק אם אתם חייבים שחזור מדויק לחלוטין של תוצאות המחקר.

pip install -U huggingface_hub
hf download mispeech/midashenglm-7b-0804-fp32

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗