GPT
L

unsloth/LFM2.5-8B-A1B-GGUF

קוד פתוח

unslothother2026-05-29

  • transformers
  • gguf
  • liquid
  • unsloth
  • lfm2.5

גרסת GGUF מכווצת של מודל היברידי קל משקל, שנועד לרוץ מקומית על מכשירי קצה ולבצע קריאות לפונקציות. הוא מפעיל רק 1.5 מיליארד פרמטרים בכל רגע כדי לחסוך זיכרון ולספק מהירות גבוהה.

  • 116 GBמשקל הקבצים
  • 24,499הורדות בחודש
  • 109לייקים

מה זה

מדובר במודל טקסט של חברת Liquid AI שהומר לפורמט GGUF על ידי Unsloth. הוא כולל 8.3 מיליארד פרמטרים בסך הכל, אך בזכות ארכיטקטורה היברידית הוא מפעיל רק 1.5 מיליארד פרמטרים בזמן אמת, מה שמאפשר לו לייצר קצב טוקנים גבוה במיוחד גם על מעבדים רגילים ללא כרטיס מסך ייעודי.

המודל אומן על 38 טריליון טוקנים עם דגש על חשיבה מובנית והפעלת כלים חיצוניים. במבחן IFEval למעקב אחר הוראות הוא הגיע לציון של 91.84, תוצאה שמציבה אותו מעל מודלים דחוסים אחרים בגודל דומה. הוא אינו מבוסס רק על מנגנון קשב רגיל אלא משלב שכבות קונבולוציה ייחודיות כדי לחתוך את עלויות החישוב.

מתאים ל

  • עוזר מקומי למכשיר קצה

    אידיאלי להרצה על מחשב נייד בלי מעבד גרפי חזק, לצורך ניהול הוראות ושרשור משימות מהיר.

  • הפעלת כלים ופונקציות

    מתאים לקריאות לפונקציות בפורמט פייתון או ג'ייסון עבור סוכנים אוטונומיים שצריכים לרוץ מקומית.

  • מערכות RAG באנגלית

    עובד טוב כשמזרימים לו מידע נקי מבחוץ, מה שמפצה על הידע הכללי המוגבל שצרוב בתוכו.

איפה זה נופל

היוצרים עצמם מבהירים שהמודל אינו מתאים למשימות תכנות כבדות או לשאלות ידע מורכבות ללא שימוש בשליפת מידע חיצונית. בנוסף, מדד AA Omniscience שלו עומד על מינוס 24.70 עם דיוק של 8.67 אחוז בלבד, כך שהסתמכות על עובדות מהזיכרון הפנימי שלו תוביל להזיות. עברית אינה מופיעה ברשימת השפות הנתמכות רשמית, ולכן פלט בעברית צפוי להיות עילג או שבור לגמרי.

אותה משפחה

LFM2.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יפעל טוב בעברית?

לא כדאי לבנות על זה. רשימת השפות הרשמית כוללת שפות כמו אנגלית, ערבית, סינית וגרמנית, אך עברית אינה חלק מהן. הוא עלול לפלוט טקסט משובש או לסרב לענות.

למה שהמודל ירוץ מהר יותר ממודל 8B רגיל?

בגלל הארכיטקטורה ההיברידית שלו. למרות שיש לו 8.3 מיליארד פרמטרים בסך הכל, בכל צעד חישוב משתתפים רק 1.5 מיליארד, מה שחוסך משמעותית בעומס על המעבד.

איך מריצים

המודל רץ ישירות דרך llama.cpp, תוכנות כמו LM Studio, או ספריית transformers של פייתון. בגלל שרק 1.5 מיליארד פרמטרים פעילים, הדרישות שלו צנועות בהרבה ממודל 8B סטנדרטי, וניתן להריץ אותו בקלות על מעבדי מחשבים ניידים או מעבדי אפל סיליקון ללא חומרה ארגונית.

אם אתם צריכים רק קריאות בודדות פעם ביום, אין טעם לתחזק שרת מקומי ועדיף לשלוח בקשות ל־API בענן. הרצה עצמית כאן משתלמת במיוחד כשרוצים אפס עלויות פר טוקן, מהירות תגובה מקומית גבוהה, או עבודה במכשירים מנותקי רשת.

ollama run hf.co/unsloth/LFM2.5-8B-A1B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר בתור other, כלומר רישיון מותאם אישית שאינו קוד פתוח סטנדרטי כמו MIT או אפאצ'י. לפני שאתם משלבים את הקבצים האלה בתוך מוצר מסחרי, חובה לפתוח את תנאי השימוש של Liquid AI ולוודא האם הפצה מסחרית מותרת ובאילו הגבלות.

הרישיון המלא בעמוד המודל ↗