GPT
L

LFM2.5-Audio-1.5B

קוד פתוח

LiquidAIother2025-12-18

  • liquid-audio
  • safetensors
  • liquid
  • lfm2
  • audio

מודל קול מקצה לקצה שמדבר ומקשיב ישירות בלי לפרק את התהליך לטקסט באמצע. הוא מתאים למי שרוצה בוט קולי מהיר עם השהיה נמוכה במיוחד על חומרה מקומית.

  • 1.5Bפרמטרים
  • 3.4 GBמשקל הקבצים
  • 1,940הורדות בחודש
  • 464לייקים

מה זה

מדובר במודל שמחבר מפענח שמע, מודל שפה של 1.2 מיליארד פרמטרים ומקודד קול לרשת אחת. במקום להריץ Whisper לתמלול, להעביר לשרת שפה ואז לסנתז קול בחזרה, הוא מקבל גלי קול ומייצר קול ישירות. יש לו שני מצבי עבודה: יצירה מקבילה שדוחפת קול וטקסט יחד כדי לקצר זמני תגובה בשיחה, ויצירה טורית שמתאימה לתמלול רגיל או הקראת טקסט.

במדדי תמלול הוא מציג ממוצע שגיאות מילים של 7.53, שזה כמעט זהה לתוצאה של Whisper Large V3 שעומד על 7.44, הישג מרשים למודל שיודע גם לדבר בעצמו. מצד שני, במבחני VoiceBench הכלליים הוא מקבל ציון כולל של 54.92. הוא עוקף בקלות את Moshi בן 7 מיליארד הפרמטרים, אבל נשאר רחוק מ־Qwen2.5-Omni שמוביל עם 63.57 במבחני היגיון וידע.

מתאים ל

  • בוט שיחה קולי באנגלית

    הארכיטקטורה מייצרת קול ישירות עם השהיה אפסית כמעט, מושלם לשיחה רציפה.

  • תמלול מקומי מהיר

    ביצועי שגיאות מילים שמשתווים ל־Whisper Large V3 בקובץ קל בהרבה.

  • עוזר קולי למכשירי קצה

    משקל של 3.4 גיגה בייט ותמיכה ב־GGUF מאפשרים ריצה על מעבד רגיל.

איפה זה נופל

החיסרון הגדול ביותר לישראלים הוא השפה. המודל תומך רשמית באנגלית בלבד, כך שאין מה לבנות עליו לשיחות או לתמלול בעברית. בנוסף, למרות ביצועי השמע המהירים, היכולות הלשוניות שלו במבחני הבנה מורכבים כמו MMSU או OBQA נמוכות משמעותית ממודלים גדולים יותר. הוא מתקשה בהיגיון כבד ולא הייתי סומך עליו לפתרון בעיות סבוכות בזמן אמת.

אותה משפחה

LFM2.5-Audio יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לשיחות בעברית?

לא. המודל הוכשר ומוגדר רשמית לאנגלית בלבד, ולכן הוא לא יבין דיבור בעברית ולא ידע לענות בה.

האם הוא דורש מנועי תמלול והקראה חיצוניים כדי לעבוד?

לא. המודל תוכנן מקצה לקצה ומכיל מקודד שמע ומפענח קול מובנים, כך שהוא קולט קול ישירות ומחזיר קול בלי רכיבים נוספים.

האם חובה להחזיק כרטיס מסך של אנבידיה בשביל להריץ אותו?

לא בהכרח. יש למודל גרסאות GGUF שמתאימות ל־llama.cpp ומאפשרות הרצה על המעבד, אם כי כרטיס מסך עם Flash Attention ייתן זמני תגובה מהירים בהרבה.

איך מריצים

ההתקנה דורשת את ספריית liquid-audio דרך pip, יחד עם תמיכה אופציונלית ב־Flash Attention 2 לזירוז ביצועים. משקל הקבצים הוא 3.4 גיגה בייט בלבד בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון מריץ אותו בלי בעיה. יש גם קובצי GGUF מותאמים שמאפשרים להריץ אותו דרך llama.cpp ישירות על המעבד בלי מאיץ גרפי בכלל.

אם אתם צריכים רק שירות ענן מהיר ולא רוצים להתעסק עם תלויות פייתון של עיבוד אותות, עדיף להשתמש ב־API מנוהל. הרצה עצמית שווה את המאמץ בעיקר למערכות שחייבות לעבוד מקומית או בקצה בלי תלות ברשת.

pip install -U huggingface_hub
hf download LiquidAI/LFM2.5-Audio-1.5B

הרישיון

הקוד והמשקלים מחולקים תחת LFM Open License v1.0, רישיון ייעודי של החברה שמוגדר במאגר כ־other ולא כרישיון קוד פתוח סטנדרטי. בנוסף, חלקי המערכת משלבים רכיבים תחת Apache 2.0, MIT ו־CC-BY 4.0. חובה לקרוא את תנאי הרישיון המקורי בקובץ המצורף לפני שמשלבים אותו במוצר מסחרי סגור כדי לוודא שאין הגבלות הפצה או דרישות קרדיט בעייתיות.

הרישיון המלא בעמוד המודל ↗