GPT
L

Ling-3.0-tiny-GGUF

קוד פתוח

bloomer010mit2026-08-11

  • llama.cpp
  • gguf
  • bailing_hybrid
  • bailingmoe3
  • mixture-of-experts

גרסת קוונטיזציה של מודל MoE קומפקטי שמפעיל רק 1.3 מיליארד פרמטרים מתוך כמעט 8 מיליארד. הוא מיועד למי שרוצה חלון הקשר ארוך ומנגנון חשיבה מקומי בלי לחנוק את כרטיס המסך.

  • 131,072טוקנים בהקשר
  • 132 GBמשקל הקבצים
  • 130,741הורדות בחודש
  • 92לייקים

מה זה

הארכיטקטורה כאן נשענת על bailingmoe3 עם 128 מומחים מנותבים ומומחה משותף אחד, כשבכל טוקן רצים רק שמונה מומחים. המבנה הזה מחזיק סך הכל 7.9 מיליארד פרמטרים, אבל בזמן ריצה מקבלים ביצועים שמזכירים מודל של 1.3 מיליארד פרמטרים בלבד. בנוסף, חלון ההקשר מגיע ל־131,072 טוקנים, מספר חריג מאוד ביחס לגודל הפעיל שלו.

המודל כולל מנגנון חשיבה מובנה שמופעל כברירת מחדל, ומשלב שכבות מסוג MLA ו־KDA לצד רכיבי Q-LoRA מובנים. המפתח מציע גרסאות קוונטיזציה מגוונות, כולל גרסאות XL מיוחדות ששומרות חלק מהמשקולות הרגישות ברמת דיוק גבוהה של שמונה ביט או BF16, כדי למנוע הידרדרות בתשובות בלי לנפח את כל הקובץ.

מתאים ל

  • הסקה על כרטיסי מסך ביתיים

    צריכת זיכרון של 6 גיגה בייט בגרסת Q4 מאפשרת להריץ אותו באופן מקומי על חומרה בסיסית בלי צווארי בקבוק.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר להזין טקסטים שלמים ומסמכים מורכבים במודל מקומי קל משקל.

  • משימות חשיבה ופתרון בעיות

    תמיכה מובנית בפיצ'ר החשיבה מאפשרת לפרק לוגיקה מורכבת לפני הפקת התשובה הסופית.

איפה זה נופל

היוצר מציין במפורש שדחיסה חזקה מדי במודלים קטנים מובילה לטעויות ולפליטת ג'יבריש, ולכן גרסאות מתחת ל־Q4 כנראה לא יתנו מענה יציב. כמו כן, מנגנון החשיבה דורש שליטה דרך תבנית הצ'אט כדי לכבות אותו במשימות פשוטות שבהן הוא סתם מבזבז טוקנים וזמן ריצה. חובה לבדוק את התנהגות המודל בהקשרים ארוכים בפועל, כי חלון של 131 אלף טוקנים על מודל פעיל כה קטן עלול לייצר בלבול במשימות שליפה מורכבות.

שאלות
נפוצות

איזו גרסת קוונטיזציה הכי מומלצת להתקנה?

אם כרטיס המסך שלכם מחזיק לפחות 6 גיגה בייט, גרסת Q4_K_M היא נקודת הפתיחה המאוזנת ביותר. אם יש לכם זיכרון פנוי של 12 גיגה בייט ומעלה, גרסת UD-Q8_K_XL תיתן דיוק שקרוב מאוד למקור.

איך מכבים את מנגנון החשיבה המובנה?

החשיבה מופעלת כברירת מחדל, אבל אפשר לבטל אותה בכל קריאה על ידי העברת enable_thinking כ־false במאפייני תבנית השיחה, או דרך עדכון קובץ ה־chat template.

האם המודל ירוץ מהר על מעבד בלבד ללא GPU?

גרסאות מסוימות עברו בדיקות ריצה על מעבד בלבד, אך מודלים מסוג MoE דורשים קריאה מהירה מהזיכרון. ללא האצת CUDA הביצועים יהיו אטיים משמעותית ביחס לכרטיס מסך ייעודי.

איך מריצים

כדי להריץ אותו צריך גרסה מעודכנת של llama.cpp שתומכת ב־bailingmoe3. הגרסאות הנפוצות כמו Q4_K_M שוקלות 4.82 גיגה בייט ודורשות סביב 6 גיגה בייט זיכרון, כך שכרטיס כמו RTX 3060 או RTX 4070 מתמודד איתן בקלות. קיימת גם גרסת MXFP4_MOE שמיועדת ספציפית לחומרת Blackwell כמו RTX סדרה 50, אבל על כרטיסים ישנים יותר היא איטית ועדיף לבחור בגרסת K רגילה.

אם יש לכם רק 2 או 3 גיגה בייט של זיכרון אפשר להשתמש בגרסאות ה־IQ המכווצות, אבל מודלים בגודל כזה מאבדים המון איכות בדחיסה אגרסיבית. אם אין לכם חומרה ייעודית בכלל ואתם צריכים רק שאילתות פה ושם, עדיף להשתמש ב־API מרוחק במקום להשקיע בקינפוג מקומי.

ollama run hf.co/bloomer010/Ling-3.0-tiny-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא MIT, מה שאומר שמותר לעשות איתו כמעט הכל. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצר סגור בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗