GPT
L

LFM2-8B-A1B

קוד פתוח

LiquidAIother2025-10-07

  • transformers
  • safetensors
  • lfm2_moe
  • text-generation
  • liquid

מודל תערובת מומחים שמשלב קונבולוציות ומפעיל רק 1.5 מיליארד פרמטרים בכל שלב. הוא מיועד למי שרוצה מהירות ריצה חריגה על מכשירי קצה בלי לחנוק את המעבד.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 27,811הורדות בחודש

מה זה

מדובר בארכיטקטורה היברידית של 8.3 מיליארד פרמטרים בסך הכול, אבל בפועל רק 1.5 מיליארד מהם פעילים בכל טוקן. המבנה מבוסס על 18 שכבות קונבולוציה קצרות ורק 6 שכבות תשומת לב מסוג GQA, מה שמוריד משמעותית את עומס החישוב הרציף.

במדדי ההוראות והמתמטיקה הוא מציג תוצאות טובות למדי ביחס למשקל הפעיל שלו, עם 84.38 ב־GSM8K ו־77.58 ב־IFEval, מספרים שעוקפים מודלים דחוסים בגודל 3 מיליארד פרמטרים. במבחני קוד מורכבים כמו LCB v6 הוא נעצר על 21.04%, שזה שיפור מגרסאות קודמות אבל עדיין רחוק ממודלים ייעודיים.

מתאים ל

  • הפעלת כלים וקריאת פונקציות

    המודל כולל תמיכה מובנית בטוקנים של הגדרת והרצת JSON, מה שמתאים לאוטומציות קלות על חומרה מקומית.

  • חילוץ מידע ו־RAG מקומי

    הוא מיועד למשימות תחומות שבהן הטקסט הרלוונטי מסופק מראש, ללא צורך בידע כללי עמוק מהזיכרון שלו.

  • שיחה מרובת תורות במכשיר

    זמני תגובה מהירים במיוחד בזכות הפעלה של 1.5 מיליארד פרמטרים בלבד בכל שלב ייצור טקסט.

איפה זה נופל

היוצרים מודים בעצמם שהמודל חלש במשימות שדורשות תכנות או ידע מעמיק ועמוס בעובדות. עם 5% בלבד של דאטה תכנותי באימון, הוא לא יכתוב לכם קוד מורכב, והתוצאה ב־HumanEval+ מגיעה ל־69.51% בלבד. בנוסף, חלון ההקשר מוגבל בכרטיס ל־32,768 טוקנים מתוך המטאדאטה, ורשימת השפות הנתמכות לא כוללת עברית, כך שכל שימוש מקומי ידרוש בדיקה מחמירה של יכולות הפענוח והדיוק לפני שילוב במערכת.

אותה משפחה

LFM2 יצא ב־12 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל מסוגל לעבוד בעברית?

השפות הרשמיות הנתמכות הן אנגלית, ערבית, סינית, צרפתית, גרמנית, יפנית, קוריאנית וספרדית. עברית אינה מופיעה ברשימה, ולכן סביר להניח שהביצועים בעברית יהיו נמוכים או מקוטעים ללא אימון נוסף.

למה להעדיף אותו על פני מודל רגיל של 3 מיליארד פרמטרים?

היתרון המרכזי הוא קצב הפקת הטוקנים. בזכות ארכיטקטורת תערובת המומחים והקונבולוציות, הוא מייצר טקסט מהר יותר ממודלים דחוסים תוך שמירה על רמת דיוק דומה במעקב אחרי הוראות.

איך מריצים

במשקל מקורי של 15.5 גיגהבייט בפורמט bfloat16, המודל דורש כרטיס מסך עם לפחות 16 עד 24 גיגהבייט זיכרון כדי לרוץ בצורה חלקה ב־vLLM או בטרנספורמרס. הוא מיועד בעיקר להרצה מקומית, ומי שרוצה לדחוף אותו למחשבים ניידים או טלפונים יצטרך גרסאות מכווצות ב־GGUF דרך llama.cpp, שם קוונטיזציה ל־int4 מורידה את דרישות הזיכרון לרמה של חומרת קצה.

אם אתם לא מריצים על מכשיר הקצה עצמו לטובת פרטיות או ניתוק מרשת, אין הרבה היגיון לתחזק שרת ענן ייעודי בשבילו. מודלים גדולים יותר דרך API יעשו עבודה טובה בהרבה באותה עלות שרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="LiquidAI/LFM2-8B-A1B")
print(pipe("שלום"))

הרישיון

הקוד מופץ תחת רישיון שנקרא LFM Open License v1.0, שמוגדר במערכת כרישיון מסוג other. זה אינו רישיון קוד פתוח סטנדרטי כמו MIT או Apache, ולכן חובה לקרוא את תנאי המסמך המלאים של החברה כדי לוודא שימוש מסחרי מותר והפצה של משקולות בתוך אפליקציות.

הרישיון המלא בעמוד המודל ↗