GPT
L

LFM2.5-2.6B-GGUF

קוד פתוח

LiquidAIother2026-08-01

  • gguf
  • liquid
  • lfm2.5
  • llama.cpp
  • text-generation

גרסת קוונטיזציה של מודל היברידי קומפקטי שמכוון כולו לריצה מקומית על חומרה חלשה. הוא מתאים למי שחייב מודל פרטי על מכשיר קצה בלי להרים שרת יקר.

  • 21.1 GBמשקל הקבצים
  • 1,066,346הורדות בחודש
  • 335לייקים

מה זה

מדובר בגרסאות GGUF של מודל בגודל 2.6 מיליארד פרמטרים מבית LiquidAI, שנבנה על ארכיטקטורה היברידית עם אימון מקדים מורחב ולמידת חיזוק. המטרה המרכזית שלו היא התקנה ישירה על מכשירי קצה, לפטופים ומערכות משובצות, בלי תלות ברשת ובלי צורך בכרטיסי מסך מפלצתיים. סך כל הקבצים במאגר שוקל 21.1 גיגה בייט ומכיל מגוון רמות דיוק.

הייחוד כאן הוא שימוש בשיטת זיקוק מודע לקוונטיזציה, מה שמכונה QAD, בגרסת ה־Q4_0. בניגוד לכיול רגיל שנעשה אחרי שהאימון הסתיים ומאבד לעיתים חדות, כאן המודל עבר תהליך זיקוק מיוחד כדי לשמור על יכולות ההיסק שלו גם כשהוא מכווץ ל־4 ביט. ברמת השפות הרשמית הוא תומך באנגלית, ערבית, סינית, צרפתית, גרמנית, הינדי, אינדונזית ואיטלקית.

מתאים ל

  • עוזר מקומי על מכשיר קצה

    הוא מיועד מראש לרוץ על חומרה צנועה ולתת מענה מקומי בלי חיבור רשת.

  • ריצה חסכונית במשאבים

    גרסת ה־QAD שומרת על ביצועים טובים גם ברמת 4 ביט וחוסכת זיכרון יקר.

  • עיבוד טקסט בלולאה סגורה

    מתאים למידע רגיש בארגון שלא יכול לצאת לשרתים חיצוניים דרך API.

איפה זה נופל

עברית לא מופיעה ברשימת השפות הנתמכות, שכוללת רק שפות כמו אנגלית, ערבית או סינית. המשמעות היא שבעברית הוא כנראה יגמגם, ימציא מילים או ייכשל לחלוטין בהבנת הנחיות. בנוסף, מודל קטן של 2.6 מיליארד פרמטרים יתקשה בהיגיון מורכב ובמעקב אחרי הוראות ארוכות ומסורבלות בהשוואה לדגמים הגדולים בתעשייה.

אותה משפחה

LFM2.5 יצא ב־15 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם כדאי לבחור בגרסת QAD Q4_0 במקום גרסת Q4_0 רגילה?

כן, גרסת ה־QAD עברה אופטימיזציה ייעודית בזמן הזיקוק כדי לצמצם פגיעה באיכות הטקסט. היא תספק בדרך כלל תוצאות מדויקות יותר מאשר קוונטיזציה רגילה שנעשית אחרי האימון.

האם המודל מתאים לפרויקטים שמבוססים על השפה העברית?

לא מומלץ לבנות עליו לפרויקטים בעברית. השפה לא נכללת ברשימת השפות שהוגדרו עבורו, ולכן סביר להניח שהפלט יהיה משובש ולא אמין.

איך מריצים

את המודל מריצים ישירות עם llama.cpp דרך שורת הפקודה, באמצעות פקודת llama-cli פשוטה שמורידה ומריצה את הקובץ. בהגדרות ההרצה המומלצות מצוין לעבוד עם טמפרטורה נמוכה של 0.1, ערך top-k של 50 ועונש חזרתיות של 1.1 כדי לקבל תשובות יציבות.

בזכות גודל של 2.6 מיליארד פרמטרים, גרסאות ה־4 ביט כמו QAD ירוצו בקלות על מעבד מחשב נייד סטנדרטי או כרטיס מסך בסיסי עם מעט זיכרון. אם אתם צריכים לשרת אלפי בקשות במקביל או משימות שדורשות הבנה מורכבת במיוחד, עדיף להשתמש ב־API חיצוני של מודל ענק ולא לנסות לדחוף את זה למכשיר מקומי.

ollama run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other בלבד, ללא פרטים מלאים בכרטיס המודל. מצב כזה מחייב בדיקה של תנאי השימוש המקוריים באתר החברה לפני שמשלבים אותו במוצר מסחרי, כדי לא להפר מגבלות הפצה או שימוש.

הרישיון המלא בעמוד המודל ↗