GPT
L

LFM2.5-2.6B-DSpark-GGUF

קוד פתוח

LiquidAIother2026-08-19

  • llama.cpp
  • gguf
  • speculative-decoding
  • dspark
  • lfm2

זהו רכיב עזר להאצת הסקת מסקנות שמיועד למודל הבסיס בגודל 2.6B. הוא מציע טוקנים קדימה כדי לקצר זמני תגובה בשימוש מקומי בלי לפגוע באיכות הפלט.

  • 1.1 GBמשקל הקבצים
  • 93,457הורדות בחודש
  • 48לייקים

מה זה

הקובץ הזה הוא לא מודל שפה עצמאי אלא מודל טיוטה קטן שפועל בשיטת פענוח ספקולטיבי. המבנה שלו כולל חמש שכבות קשב בלבד, ראש מרקוב וראש ביטחון, כשהוא חולק את הטוקנייזר וראש השפה ישירות ממודל המטרה בזמן הטעינה.

המטרה כאן היא מהירות נטו. מודל הטיוטה מנחש קבוצות של עד תשעה טוקנים בכל מחזור, ומודל המטרה רק מאמת אותם. היות שכל טוקן עובר אימות מלא, התוצאה הסופית זהה לחלוטין להרצה רגילה של המודל הגדול, רק בקצב הפקה מהיר בהרבה.

ההבדלים בין הגרסאות נוגעים לדיוק הניחוש. גרסת F16 ששוקלת 664 מגה מציעה את אורך הקבלה הטוב ביותר, Q8_0 יורדת בשני אחוזים, וגרסת Q4_K_M הקטנה ביותר מאבדת שלושה אחוזים ביחס למקור אך חוסכת מקום בזיכרון.

מתאים ל

  • האצת הסקה מקומית

    שילוב עם מודל המטרה בשרת פנימי כדי לקבל קצב טוקנים גבוה בהרבה בלי לשנות את התוכן.

  • עבודה על מחשבים ניידים

    הרצה מקומית על חומרה צנועה תוך ניצול גרסת ה־191 מגה לחסכון מקסימלי במשאבים.

  • צמצום השהיה בצ'אט

    הורדת זמני ההמתנה למשתמשי קצה ביישומים אינטראקטיביים שדורשים תגובה מהירה.

איפה זה נופל

החיסרון המרכזי הוא שמדובר בחצי פתרון שאינו מסוגל לייצר מילה אחת לבדו. בלי קובץ המטרה התואם LFM2.5-2.6B-GGUF, הקובץ הזה חסר תועלת לחלוטין. מעבר לזה, המפתחים מזהירים מראש שכימות מתחת לארבע ביט פוגע קשות גם באורך רצף הטוקנים המתקבל וגם בתפוקה הכוללת, ולכן אין אפשרות לכווץ אותו מעבר לגרסת Q4_K_M.

שאלות
נפוצות

האם אפשר להריץ את הקובץ הזה לבד כדי לענות על שאלות?

לא. הקובץ מכיל רק שכבות טיוטה ואין לו שכבות שפה מלאות או וקטורי מילים עצמאיים. הוא חייב לעבוד בצמוד לקובץ המטרה של LFM2.5-2.6B כדי לייצר פלט כלשהו.

האם השימוש בטיוטה פוגע באיכות התשובות של המודל?

ממש לא. מודל המטרה מאמת כל טוקן שמוצע לו ומאשר רק מה שתואם למשקלים המקוריים שלו. הפלט שמתקבל זהה לחלוטין להרצה רגילה של המודל הראשי בלי הטיוטה.

איזו גרסת כימות כדאי להוריד מתוך השלוש?

אם יש לכם מקום בזיכרון, גרסת F16 נותנת את שיעור הניחושים המדויק ביותר. אם הזיכרון לחוץ, גרסת Q4_K_M מאבדת רק שלושה אחוזי דיוק בניחוש וחוסכת מאות מגה בייטים.

איך מריצים

מריצים אותו דרך llama.cpp תוך שימוש בדגל ייעודי לפענוח ספקולטיבי לצד קובץ המטרה התואם. המשקל שלו נע בין 191 ל־664 מגה בייט בלבד, כך שמבחינת חומרה מדובר בתוספת זניחה לזיכרון של המעבד הגרפי או הזיכרון המאוחד במחשב.

אם אתם כבר מריצים את מודל המטרה על מחשב מקומי או שרת עצמאי, שווה להוסיף את קובץ הטיוטה כדי להרוויח מהירות בלי עלות חומרה משמעותית. לעומת זאת, אם אין לכם תשתית מקומית מתאימה או שאתם צריכים רק קריאות בודדות פעם ביום, פנייה לשירות ענן מנוהל תחסוך את כאב הראש של ניהול שני קבצים במקביל.

ollama run hf.co/LiquidAI/LFM2.5-2.6B-DSpark-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כרישיון מותאם אישית של LiquidAI ולא כרישיון קוד פתוח סטנדרטי. המשמעות היא שחובה להיכנס למסמכי החברה ולבדוק את ההגבלות המשפטיות לפני שמשלבים אותו במוצר מסחרי, בעיקר סביב הפצה והטמעה במכשירי קצה.

הרישיון המלא בעמוד המודל ↗