GPT
L

LFM2-Audio-1.5B

קוד פתוח

LiquidAIother2025-08-28

  • liquid-audio
  • safetensors
  • liquid
  • lfm2
  • audio

מודל קול מקצה לקצה שמנהל שיחה קולית רציפה בלי לחבר מודלי תמלול והקראה נפרדים. שוקל מעט ומתאים למי שמחפש זמני תגובה אפסיים על שרת קטן.

  • 1.5Bפרמטרים
  • 3.1 GBמשקל הקבצים
  • 368הורדות בחודש
  • 362לייקים

מה זה

הארכיטקטורה כאן מחברת שלד שפה היברידי של 1.2 מיליארד פרמטרים עם מקודד FastConformer ומפענח קולי מבוסס Mimi. במקום להעביר אודיו לטקסט ומשם למודל שפה וחזרה לקול, הוא מעבד ומייצר טוקנים של אודיו ישירות. זה מאפשר שני מצבי עבודה, יצירה מקבילה שמתאימה לצ'אט קולי בזמן אמת, ויצירה סדרתית שמשמשת לתמלול או הקראה.

במדדי תמלול הוא מציג שגיאת מילים ממוצעת של 7.24 אחוז, תוצאה טובה יותר מ־Whisper Large V3 שמגיע ל־7.93 אחוז באותו סדר גודל של משקל. במבחני הבנה קולית כלליים הוא משיג ציון משוקלל של 56.78, גבוה משמעותית ממודלים כמו Moshi שמגיע ל־29.51, אך נמוך מ־Qwen2.5-Omni שמוביל עם 63.57.

מתאים ל

  • בוט שיחה קולי באנגלית

    מאפשר תגובה מיידית בדיבור ללא עיכובים של חיבור בין כלי תמלול למודל שפה.

  • תמלול אודיו מהיר מקומית

    מציג דיוק שעוקף את Whisper Large V3 ומתאים להרצה חסכונית במשאבים.

  • הקראת טקסט ואינטראקציה

    ייצור ישיר של אודיו בפורמט טוקנים בלי צורך במנוע הקראה חיצוני.

איפה זה נופל

החיסרון המרכזי למפתח הישראלי הוא השפה. המודל תומך באנגלית בלבד, ואין לו יכולת מובנית להתמודד עם שיחות או תמלול בעברית. בנוסף, יכולות ההיגיון שלו חלשות בהשוואה למודלים גדולים יותר. במבחן BBH הוא עומד על 30.54 בלבד מול 61.30 של Qwen2.5-Omni, ובשאלות ידע כללי של MMSU הוא מקבל 31.95. זה אומר שהוא מצוין לשיחה פשוטה ומהירה, אך עלול להיכשל כשנדרשת הבנה לוגית מורכבת.

אותה משפחה

LFM2-Audio יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד בעברית?

לא. המודל תומך רשמית אך ורק באנגלית, הן לקלט והן לפלט. ניסיון לדבר אליו בעברית לא יפיק תוצאות שמישות.

כמה זיכרון כרטיס מסך נדרש להרצה שלו?

המשקלים תופסים 3.1 גיגה בייט בזיכרון. כרטיס מסך עם 8 גיגה זיכרון יריץ אותו בקלות יחד עם ההקשר המלא של 32,768 טוקנים.

מה ההבדל בין יצירה מקבילה ליצירה סדרתית?

יצירה מקבילה משלבת טקסט וקול בו זמנית כדי לקצר את זמן ההמתנה בשיחות חיות. יצירה סדרתית מיועדת למשימות כמו תמלול בלבד או הקראה בלבד.

איך מריצים

כדי להריץ אותו מתקינים את החבילה liquid-audio בפייתון. הקבצים שוקלים 3.1 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יספיק לגמרי להרצה מקומית. לחלופין אפשר להשתמש ב־torch SDPA אם אין תמיכה ב־Flash Attention 2.

ההפעלה הפשוטה ביותר היא דרך ממשק Gradio מובנה שרץ על פורט 7860. אם כל מה שאתם צריכים זה שירות ענן יציב בלי לתחזק תשתית, עדיף לפנות ל־API חיצוני, אבל הגודל הצנוע שלו הופך אירוח עצמי לזול ופשוט מאוד.

pip install -U huggingface_hub
hf download LiquidAI/LFM2-Audio-1.5B

הרישיון

הוא מופץ תחת LFM Open License v1.0, לצד רכיבים ברישיונות Apache 2.0, MIT ו־CC-BY 4.0 עבור המקודדים והמשקולות המשולבות. הרישיון לא מוגדר כרישיון קוד פתוח סטנדרטי, לכן יש לבדוק היטב את תנאי ההסכם של Liquid AI לפני שילוב שלו במוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗