GPT
L

unsloth/LFM2.5-1.2B-Instruct-GGUF

קוד פתוח

unslothother2026-01-06

  • transformers
  • gguf
  • liquid
  • unsloth
  • lfm2.5

גרסה מכווצת של מודל קטן במיוחד, שמתמקדת בהרצה מקומית מהירה וצריכת זיכרון מינימלית. הוא מתאים למי שרוצה להריץ סוכן או משימות חילוץ מידע ישירות על חומרה חלשה בלי שרת ייעודי.

  • 15.1 GBמשקל הקבצים
  • 66,670הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל שפה קומפקטי בעל 1.17 מיליארד פרמטרים, שנוצר בארכיטקטורה היברידית המשלבת שכבות קונבולוציה עם מנגנוני תשומת לב מסוג GQA, ואומן על 28 טריליון טוקנים. הוא מגיע עם חלון הקשר של 32,768 טוקנים ומיועד בראש ובראשונה לפעול על גבי מכשירי קצה, לפענוח פקודות ולהפעלת כלים חיצוניים.

במדדי ההערכה מול מודלים אחרים באזור ה־1B עד 2B, המודל עוקף חלופות כמו Llama 3.2 1B ו־Gemma 3 1B בפער ניכר במבחני הבנת הוראות דוגמת IFEval שבו קיבל 86.23 נקודות, ו־49.12 במבחן הפעלת הפונקציות BFCLv3. הנתונים האלה מעידים שהוא ממושמע יותר למבנה של פקודות מורכבות ביחס לגודלו, ולא מתפזר בקלות כשמבקשים ממנו פלט ספציפי.

מתאים ל

  • הפעלת פונקציות מקומית

    חילוץ פרמטרים והרצת קריאות API אוטומטיות ישירות על מעבד המכשיר ללא תלות ברשת.

  • שליפת מידע במערכות RAG

    סינון ועיבוד מקטעי טקסט קצרים בתוך חלון הקשר נרחב, תוך צריכת זיכרון אפסית.

  • חילוץ נתונים מובנים

    המרת טקסט חופשי למבנה JSON מוגדר היטב בזכות משמעת גבוהה להנחיות.

איפה זה נופל

היוצרים של המודל מציינים בפירוש שהוא לא מתאים למשימות הדורשות ידע עמוק או לכתיבת קוד ותכנות. בנוסף, רשימת השפות הרשמית שלו כוללת אנגלית, ערבית, סינית, צרפתית, גרמנית, יפנית, קוריאנית וספרדית, כך שעברית לא נתמכת בו באופן רשמי. ניסיון להשתמש בו לניתוח טקסטים בעברית צפוי להיתקל בשיבושים, פליטת ג'יבריש ואיכות נמוכה.

אותה משפחה

LFM2.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

לא באופן רשמי. רשימת השפות הנתמכות כוללת אנגלית ומספר שפות אירופאיות ואסיאתיות, אך עברית נעדרת ממנה, ולכן לא מומלץ להסתמך עליו בעיבוד טקסט ישראלי.

איזה כוח מחשוב נחוץ כדי להריץ את המודל?

הוא מתוכנן לעבוד עם פחות מ־1GB של זיכרון RAM או VRAM. אפשר להריץ אותו ישירות על מעבד רגיל, מעבד סלולרי או NPU באמצעות llama.cpp בלי שום צורך בכרטיס מסך חזק.

האם המודל מסוגל לכתוב קוד?

לא. מפתחיו מבהירים במפורש שהוא אינו מיועד לתכנות או למשימות עתירות ידע, וכדאי להגביל אותו לחילוץ מידע, סוכנים ומענה מובנה.

איך מריצים

ההרצה המעשית מתבצעת ישירות דרך כלי GGUF מוכרים כמו llama.cpp, כאשר Unsloth מדגישים שחובה להפעיל את הדגל jinja כדי שתבנית השיחה תעבוד נכון. המודל דורש פחות מגיגה־בייט בודד של זיכרון עבודה, מה שמאפשר לו לרוץ בקלות על מעבדי מחשבים ניידים פשוטים, מכשירי טלפון או מעבדי NPU ייעודיים, שם הוא מגיע לקצבי פענוח של עשרות עד מאות טוקנים בשנייה.

אם אתם צריכים רק להפעיל שירות קצה מבודד או כלי מקומי בלי חיבור לרשת, אין סיבה להשתמש ב־API חיצוני. לעומת זאת, אם השרת שלכם כבר מטפל בעומסי עבודה כבדים או זקוק לתשובות שדורשות ידע כללי רחב, שירותי ענן גדולים עדיין ייתנו תמורה טובה יותר.

ollama run hf.co/unsloth/LFM2.5-1.2B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המוגדר הוא other, וכרטיס המודל לא מפרט את תנאי השימוש המדויקים אלא מפנה ליצירת קשר במייל מול חברת Liquid AI לפתרונות ארגוניים. כל עוד לא בדקתם את מסמך הרישיון המקורי של המפתחת, אי אפשר להניח שמותר להפיץ אותו באופן מסחרי במוצר שלכם.

הרישיון המלא בעמוד המודל ↗