GPT
L

LFM2-24B-A2B-GGUF

קוד פתוח

LiquidAIother2026-02-17

  • transformers
  • gguf
  • liquid
  • lfm2
  • edge

ארכיטקטורת תערובת מומחים שמפעילה רק 2 מיליארד פרמטרים מתוך 24 בפועל. פתרון שנועד לתת מהירות גבוהה על מחשבים אישיים בלי לדרוש שרת ייעודי.

  • 172 GBמשקל הקבצים
  • 11,824הורדות בחודש
  • 152לייקים

מה זה

מדובר במודל היברידי מסוג תערובת מומחים (MoE) שמחזיק 24 מיליארד פרמטרים בסך הכול, אבל מנתב כל טוקן לשני מיליארד בלבד בזמן הריצה. הרעיון כאן הוא לקבל יכולת של מודל גדול בהרבה בלי לשלם בזמן עיבוד כבד על כל מילה שיוצאת.

לפי נתוני היצרן, המבנה הזה מחלץ מהירויות של 112 טוקנים לשנייה על מעבד AMD ועד 293 טוקנים לשנייה על כרטיס H100. הכרטיס מדווח על תמיכה בשפות כמו אנגלית, ערבית, סינית, צרפתית, גרמנית, יפנית, קוריאנית וספרדית, אבל עברית לא מופיעה ברשימה הזו.

מתאים ל

  • עבודה מקומית ללא שרת

    רץ ישירות על מחשב נייד עם 32 גיגה זיכרון בזכות ניתוב של 2 מיליארד פרמטרים פעילים בלבד.

  • שירותים מרובי שפות

    מתאים לעבודה בשפות הנתמכות כמו אנגלית, ערבית, צרפתית וספרדית בלי להחזיק מודל ענק.

  • מענה מהיר בזמן אמת

    מגיע לקצב גבוה של מעל מאה טוקנים לשנייה אפילו על מעבדי מחשב רגילים ללא תלות בענן.

איפה זה נופל

עברית לא רשומה בשפות הנתמכות של המודל, ולכן כל שימוש בעברית דורש בדיקה מעמיקה של איכות הפלט וההבנה לפני שבונים עליו משהו אמיתי. בנוסף, מודל שמפעיל רק 2 מיליארד פרמטרים אקטיביים עלול להציג פשרות בהסקה מורכבת או משימות עמוקות ביחס למודלים צפופים מלאים באותו סדר גודל כללי.

אותה משפחה

LFM2 יצא ב־12 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב רגיל?

כן, בתנאי שיש לכם לפחות 32 גיגה זיכרון RAM. המודל תוכנן לעבוד על מעבדים ביתיים דרך llama.cpp ומספק ביצועים מהירים יחסית לגודל שלו.

האם הוא מתאים לשימוש בעברית?

עברית לא נכללת ברשימת השפות הרשמיות של המודל. מומלץ לבדוק אותו ידנית על טקסטים בעברית כדי לראות אם הוא בכלל מחזיר תוצאות סבירות לפני שמתכננים לשלב אותו במערכת.

איך מריצים

המודל מגיע בפורמט GGUF ונתמך ישירות בכלים מוכרים כמו llama.cpp, vLLM ו־SGLang. לפי הכרטיס הוא נכנס ב־32 גיגה זיכרון RAM, כך שאפשר להריץ אותו מקומית על מחשבים ניידים ונייחים חזקים בלי כרטיס מסך ארגוני מפלצתי.

אם יש לכם מחשב עם פחות מ־32 גיגה זיכרון, אין מה לנסות לדחוף אותו לשם. במצב כזה, או כשצריך לשרת משתמשים רבים במקביל, עדיף להשתמש ב־API או בשרת מרוחק במקום לחנוק את החומרה המקומית.

ollama run hf.co/LiquidAI/LFM2-24B-A2B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר בתור other ולא רישיון קוד פתוח סטנדרטי ומוכר. אי אפשר לדעת מהכרטיס אם מותר להשתמש בו לצרכים מסחריים או לשלב אותו במוצר מסחרי בלי לבדוק ישירות את תנאי השימוש המלאים של החברה באתר שלהם.

הרישיון המלא בעמוד המודל ↗