GPT
Q

Qwen3.8-27B-APEX-GGUF

קוד פתוח

mudlerapache-2.02026-08-17

  • gguf
  • quantized
  • apex
  • dense
  • hybrid-attention

גרסת כיול מיוחדת של מודל 27B שנדחס לכרטיסי מסך ביתיים בלי לאבד את הראש. הוא שומר על איכות טובה יותר מכיול סטנדרטי בדיוק בגדלים שמתאימים לזיכרון של 12 או 16 גיגה.

  • 24.3 GBמשקל הקבצים
  • 34,552הורדות בחודש
  • 76לייקים

מה זה

מי שבנה את הקבצים האלה לא חתך ביטים בצורה אחידה, אלא מדד כמה נזק נגרם לדיוק כשדוחסים כל שכבה בנפרד. התוצאה היא חלוקה שונה מהרגיל. שכבות רגישות כמו שכבת הפלט קיבלו יותר ביטים, בעוד שמשקלים סלחניים יותר נחתכו חזק. במדידות הסטייה מול מודל המקור, גרסת Mini בגודל 13.49 גיגה יצאה טובה ב־25% מכיול רגיל באותו משקל, וגרסת Nano של 10.79 גיגה יצאה טובה ב־22.1%.

המודל כולל בתוכו ראש חיזוי מובנה שמאיץ את ייצור הטקסט ומגיע ברמת דיוק גבוהה של שמונה ביט כדי למנוע ניחושים שגויים. בנוסף יש קובץ מקרן ראייה נפרד של 0.93 גיגה, שמאפשר לחבר אליו יכולות פענוח תמונה.

מתאים ל

  • שרת מקומי על כרטיס 16GB

    גרסת Mini נכנסת במלואה לזיכרון ונותנת איכות גבוהה ברבע פחות שגיאות בהשוואה לחלופות.

  • הפעלה חסכונית בכרטיס 12GB

    גרסת Nano מאפשרת להריץ מודל 27B שלם בחומרה ביתית נפוצה בלי לקרוס מחוסר מקום.

  • עיבוד טקסט ותמונה מקומי

    חיבור קובץ הראייה הנפרד נותן יכולת רב־מודאלית על אותה חומרה מוגבלת בלי להחליף מנוע.

איפה זה נופל

החיסרון הבולט הוא מהירות הריצה, שלא נמדדה בפועל. סוגי הכיול השונים מפעילים קרנלים שונים במעבד הגרפי, ולכן איכות מתמטית גבוהה לא מבטיחה ביצועים מהירים. הדיווחים על שיפור של 35% עד 52% במהירות עם ראש החיזוי מגיעים ממקור צד שלישי בלבד ולא אומתו בכרטיס המודל. בנוסף, בגלל מגבלות טכניות בכיול שכבת ההטמעה, אי אפשר לדחוס אותה לסוגים נמוכים מאוד כמו IQ2_XXS, והמספרים תקפים רק למבנה השכבות הספציפי הזה.

שאלות
נפוצות

איזו גרסה כדאי להוריד למחשב עם כרטיס מסך של 16GB?

הורידו את גרסת Mini ששוקלת 13.94 גיגה. היא מותאמת ישירות לנפח הזיכרון הזה ומספקת שחזור מדויק בהרבה מכיול רגיל בגודל מקביל. אם אתם מתכננים להזין גם תמונות, תצטרכו להוסיף את קובץ הראייה ששוקל קרוב לגיגה נוסף.

למה אין להורדה גרסאות גדולות ואיכותיות יותר כמו Q4 או Q6?

מדידות המפתחים הראו שהחלוקה הדינמית יעילה רק בקבצים קטנים מ־15.2 גיגה. בנפחים גדולים יותר המודל כבר כמעט נטול הפסדים בכל מקרה, ושם השיטה הזו אפילו הפסידה בביצועים לכיולים הרגילים שקיימים ברשת.

התוכנה קורסת עם שגיאת Segfault מיד בטעינה, מה הבעיה?

אתם משתמשים בגרסה ישנה של llama.cpp שלא תומכת בארכיטקטורה הזו. המודל שוחרר באמצע אוגוסט 2026 והתמיכה בו נוספה רק לאחר מכן, כך שצריך לעדכן את התוכנה לגרסה חדשה כדי שהיא תזהה אותו.

איך מריצים

טוענים את הקובץ דרך llama.cpp פשוט, אבל חייבים גרסה עדכנית שתומכת בארכיטקטורה שלו אחרת התוכנה קורסת מיד בהפעלה. אם יש לכם כרטיס עם 16 גיגה זיכרון גרפי, גרסת Mini ששוקלת 13.94 גיגה נכנסת בשלמותה. לכרטיסי 12 גיגה לוקחים את Nano ששוקלת 11.24 גיגה. שניהם מריצים פענוח ספקולטיבי ישירות מהקובץ בלי מודל עזר נוסף.

אם אתם צריכים איכות מקסימלית בלי מגבלת זיכרון מקומית, עדיף להשתמש במודל המלא דרך שרת מרוחק. החלוקה החכמה הזו נותנת יתרון רק כשחייבים לדחוס לפחות מ־15.2 גיגה. במשקלים גבוהים יותר, כמו 17.65 גיגה, הכיול הזה יצא בבדיקות גרוע ב־14% מכיול שטוח סטנדרטי.

ollama run hf.co/mudler/Qwen3.8-27B-APEX-GGUF:Qwen3.8-27B-APEX-I-Nano

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 24.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, להריץ אותו על שרתים ולהפיץ אותו במוצר שלכם. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים ועותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗