GPT
L

LFM2-8B-A1B-GGUF

קוד פתוח

LiquidAIother2025-10-06

  • transformers
  • gguf
  • liquid
  • lfm2
  • edge

גרסת GGUF לארכיטקטורת תערובת מומחים שפותחה לריצה מקומית על מכשירי קצה. מקבלים כאן נפח חישובי של מודל קטן עם ביצועים שמתקרבים למודלים צפופים כבדים בהרבה.

  • 44.8 GBמשקל הקבצים
  • 9,721הורדות בחודש
  • 118לייקים

מה זה

מדובר בארכיטקטורה היברידית מסוג תערובת מומחים (MoE) שמכילה 8.3 מיליארד פרמטרים בסך הכל, אך מפעילה רק כ־1.5 מיליארד פרמטרים בכל שלב ייצור. המבנה הזה נבנה מראש כדי לעקוף את צוואר הבקבוק של כוח עיבוד וסוללה במכשירים אישיים.

לפי היצרן, השילוב הזה מייצר תוצאות שמקבילות למודלים צפופים של 3 עד 4 מיליארד פרמטרים, אבל רץ מהר יותר ממודל קטן כמו Qwen3-1.7B. בהשוואה לגרסאות מוקדמות של המפתחת, הדגם הנוכחי אמור לתת שיפור מורגש בקטעי קוד ובשליפת עובדות.

קובצי ה־GGUF מאפשרים טעינה ישירה לספריות תומכות ומיועדים להתאים לחומרה מוגבלת, כולל טלפונים ומחשבים ניידים ברמה גבוהה.

מתאים ל

  • עוזר מקומי למחשב נייד

    מפעיל רק 1.5 מיליארד פרמטרים ולכן שומר על חיי סוללה וביצועים מהירים.

  • השלמת קוד בסיסית באופליין

    מציג יכולות קוד משופרות תוך שמירה מלאה על פרטיות בלי לשלוח פקודות לענן.

  • בוט שיחה במכשירי קצה

    רץ ישירות דרך llama.cpp על חומרה מוגבלת בלי להזדקק לשרתים חיצוניים.

איפה זה נופל

עברית בכלל לא מופיעה ברשימת השפות הנתמכות שכוללת אנגלית, ערבית, סינית, צרפתית, גרמנית, יפנית, קוריאנית וספרדית. מי שבונה על פרויקט מקומי בעברית יצטרך לבדוק בעצמו אם המודל לא מייצר ג'יבריש או מתרגם עקום. בנוסף, מודל שמפעיל 1.5 מיליארד פרמטרים עדיין מוגבל מאוד בהבנה עמוקה והסקה לוגית מורכבת לעומת מודלים צפופים גדולים.

אותה משפחה

LFM2 יצא ב־12 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל יפעל טוב עם פרומפטים בעברית?

השפה העברית לא נכללת ברשימת השפות הרשמית של המודל. יש סיכוי סביר שתקבלו תוצאות שבורות, ניסוחים קלוקלים או הזיות, ולכן לא מומלץ להסתמך עליו למשימות בעברית בלי בדיקה מוקדמת.

כמה זיכרון דרוש כדי להריץ את המודל בפועל?

למרות שנפח כלל הקבצים להורדה הוא 44.8 גיגה־בייט, מדובר בכמה גרסאות שונות. בפועל מורידים רק קובץ קוונטיזציה יחיד, שבזכות ארכיטקטורת ה־MoE דורש מעט מאוד משאבים ומסוגל לעבוד גם על טלפונים ומחשבים ניידים חזקים.

איך מריצים

ההרצה המקומית מתבצעת ישירות דרך llama.cpp באמצעות הפקודה llama-cli עם מזהה המודל. סך כל הקבצים במאגר שוקל 44.8 גיגה־בייט ומחולק לתשעה קבצים, כך שבוחרים רק את רמת הקוונטיזציה שמתאימה לחומרה שברשותכם במקום להוריד את הכל.

גרסאות מכווצות יעבדו היטב על זיכרון של מחשב נייד חזק, טאבלט או טלפון מתקדם בלי לדרוש מעבד גרפי מקצועי. אם המטרה שלכם היא להריץ משימות מורכבות בעומס גבוה בלי תלות בחומרה האישית של משתמשי הקצה, עדיף לפנות ל־API ייעודי ברשת במקום לדחוף משקלים כאלה למכשיר.

ollama run hf.co/LiquidAI/LFM2-8B-A1B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי ומוכר. אי אפשר לדעת מהכרטיס אם מותר לשלב אותו במוצר מסחרי, להפיץ אותו הלאה או לגבות עליו תשלום. לפני שנוגעים בו בקוד עסקי, חייבים לקרוא את תנאי השימוש שהחברה מצרפת בקישורים שלה.

הרישיון המלא בעמוד המודל ↗