GPT
L

Ling-3.0-flash-GGUF

קוד פתוח

AtomicChatmit2026-08-04

  • llama.cpp
  • gguf
  • imatrix
  • moe
  • text-generation

גרסת קוונטיזציה חכמה למודל מומחים של 124 מיליארד פרמטרים שמפעיל בפועל רק 5.1 מיליארד בכל טוקן. מקבלים מודל ענק עם מהירות תגובה של מודל קטן, בתנאי שיש לכם מספיק זיכרון להחזיק אותו.

  • 2.1 TBמשקל הקבצים
  • 269,445הורדות בחודש
  • 60לייקים

מה זה

מדובר בהמרה לפורמט GGUF של Ling-3.0-flash, מודל שמבוסס על שילוב של לינאר אטנשן וארכיטקטורת מומחים עם 512 מומחים שונים. במקום לחתוך את כל המשקולות באופן אחיד, מי שהכין את הקבצים השאיר את הנתבים ברמת דיוק מלאה של F32, את שכבות הקשב בפורמט Q8_0, ודחס בעיקר את המומחים עצמם שמהווים מעל 97 אחוז מהמשקל הכולל.

הגישה הזו מוכיחה את עצמה במדידות. גרסת AD-Q5_K_M למשל מציגה מרחק התפלגות של 0.0242 מול מודל המקור הלא מכווץ, שזה 31 אחוז פחות שגיאה מאשר אותה דחיסה דרך llama.cpp הרגיל. בבדיקות על ארבעה כרטיסי RTX PRO 6000, הוא מייצר מעל 106 טוקנים לשנייה ועיבוד קלט של יותר מ־3300 טוקנים לשנייה.

מתאים ל

  • עוזר פיתוח מקומי בצוות

    תבנית השיחה תומכת מראש בהפעלת כלים ובמצב חשיבה, והמודל עונה מהר בזכות הפעלת 5.1 מיליארד פרמטרים בלבד בכל שלב.

  • עיבוד טקסטים ארוכים בשרת

    הארכיטקטורה משלבת לינאר אטנשן ומעבדת מעל 3300 טוקנים לשנייה בקלט על חומרה מתאימה, בלי לחנוק את הזיכרון.

  • הפעלה בתחנות עבודה של אפל

    גרסת ה־89 ג'יגה רצה ישירות דרך Metal ב־Mac Studio עם 128GB זיכרון מאוחד, בלי צורך בספריות נוספות.

איפה זה נופל

המגבלה הכי גדולה היא שהמרה הזו זורקת לפח את בלוק ה־MTP, כך שאי אפשר להשתמש בפיענוח ספקולטיבי כדי להאיץ את הפלט. בנוסף, קובצי ה־NVFP4 רצים מהר רק על כרטיסי Blackwell של אנבידיה עם ליבות מתאימות, ובכל חומרה אחרת הם עוברים המרה איטית לאחור בזמן אמת. משתמשי כרטיסי מסך של אינטל יצטרכו לקמפל תמיכה בעצמם כי אין קובץ בינארי מוכן ל־SYCL, ובגרסאות המכווצות מתחת ל־4 ביט הפלט מתחיל להישבר באחוזון הקיצון.

שאלות
נפוצות

האם המודל יעבוד לי על גרסה רגילה של llama.cpp?

לא. הקבצים האלה דורשים את הגרסה של TurboQuant שמכילה תיקוני באגים ספציפיים לארכיטקטורת המומחים הזו, ויש להוריד את הקבצים המוכנים מהקישור שמצורף אליהם.

כמה זיכרון כדאי להקצות לקובץ של 74 ג'יגה?

תצטרכו מערכת עם לפחות 96 ג'יגה זיכרון. משקולות המודל והקשר השיחה חולקים את אותו הזיכרון, כך שאי אפשר להעמיס קובץ כזה על מכונה של 80 ג'יגה בלי לקבל קריסה.

מה היתרון של גרסאות ה־AD לעומת קבצי GGUF סטנדרטיים?

בגרסאות האלה השאירו את הנתבים ורכיבי הקשב בדיוק מרבי ודחסו רק את המומחים. בפועל מקבלים שגיאה נמוכה ב־30 עד 40 אחוז לעומת כיווץ רגיל באותו נפח דיסק בדיוק.

איך מריצים

כדי להריץ את הקבצים צריך גרסה מותאמת בשם TurboQuant שמכילה תיקונים לארכיטקטורה הזו. המפתחים מספקים קבצים בינאריים מוכנים ללינוקס, ווינדוס ומק, כך שלא צריך לקמפל שום דבר לבד. פקודת ההרצה דורשת שימוש ב־llama-cli עם דגל jinja לתבנית השיחה, ומגדירה חלון הקשר של 32768 טוקנים.

מבחינת חומרה, קובץ הברירת מחדל ששוקל 89.4 ג'יגה מצריך מערכת עם 128 ג'יגה זיכרון, כמו שרת עם שני כרטיסי RTX 4090 או Mac Studio חזק. אפשר לרדת עד לקבצי IQ2 או IQ1 שנכנסים ב־48 או 32 ג'יגה, אבל הפגיעה באיכות התוצאות שם כבר מורגשת מאוד. אם אין לכם חומרה ייעודית כזו במשרד, עדיף להשתמש ב־API מרוחק.

ollama run hf.co/AtomicChat/Ling-3.0-flash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

67 קבצים במאגר, 2.1 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT. מותר לעשות עם הקבצים כמעט הכל, כולל הטמעה במוצרים מסחריים סגורים ושימוש פנימי בחברות, בלי צורך לשלם תמלוגים או לחשוף את קוד המקור של המערכת שלכם. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗