GPT
Q

Qwen3.8-27B-Heretic-Ara-16GB-VRAM-IQ4-XS-MTP-GGUF

קוד פתוח

Bucoidapache-2.02026-08-18

  • gguf
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קוונטיזציה של מודל 27B שעבר הסרת סינון, מכוונת בדיוק לכרטיסי 16 גיגה זיכרון. היא שומרת על התנהגות קרובה מאוד למקור ומציעה חלון הקשר ענק מקומית.

  • 39.1 GBמשקל הקבצים
  • 86,426הורדות בחודש
  • 51לייקים

מה זה

המודל מבוסס על גרסה ללא צנזורה של Qwen בנפח 27 מיליארד פרמטרים, שעברה אבבלציה מסוג Heretic Arbitrary-Rank Ablation. המטרה כאן היא לקחת משקל כבד שבמקור תופס מעל 50 גיגה בפורמט BF16, ולדחוס אותו לפורמט IQ4_XS של 4 ביט כך שירוץ על חומרה צרכנית רגילה.

מבחני ההשוואה מראים שהקוונטיזציה בוצעה ברמה טובה מאוד. הערכים של הבלבול עולים מ־7.008 במקור ל־7.046 בלבד בגרסה 3.0, עם מתאם של 99.34 אחוזים מול המקור והתאמה של 92.86 אחוזים בבחירת הטוקן המוביל. בהשוואה לדחיסת Q3_K_M בנפח דומה, הגרסה הזו מציגה סטייה הסתברותית נמוכה משמעותית.

מתאים ל

  • הרצה מקומית על כרטיס יחיד

    ניצול מלא של כרטיסי 16 גיגה עם חלון הקשר שמגיע עד 110 אלף טוקנים.

  • מחקר ועיבוד טקסט ללא סינון

    מענה על שאילתות ונושאים שמודלים מסחריים רגילים מסרבים לגעת בהם.

  • הסקה מהירה באמצעות MTP

    שימוש בגרסת המולטי-טוקן למי שמעדיף קצב יצירה מהיר על חשבון חלק מההקשר.

איפה זה נופל

המודל עבר הסרת צנזורה מכוונת, מה שאומר שאין בו מנגנוני בטיחות סטנדרטיים והוא עלול לפלוט תוכן פוגעני או רעיל ללא סינון. בנוסף, בעדכון מ־22 באוגוסט המפתח תיקן בעיות בתהליך החשיבה שלו, אך כדאי לבדוק לעומק את איכות ההסקה. יש גם לשים לב שהפיזור המרבי עומד על 18.3, מה שמצביע על מקרים נקודתיים שבהם הדחיסה משנה לחלוטין את התנהגות המודל לעומת המקור.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על כרטיס מסך שמשמש גם למסך המחשב?

לא מומלץ. הנתונים בכרטיס המודל מבוססים על כרטיס ייעודי ללא עומס תצוגה. אם מערכת ההפעלה תופסת גיגה או שניים, לא תוכלו להגיע להקשרים ארוכים של 80 אלף טוקנים בלי לחרוג מהזיכרון.

מה ההבדל המעשי בין גרסת ה־MTP לגרסה הרגילה?

גרסת ה־MTP תופסת קצת יותר זיכרון, כ־13.3 גיגה לעומת 13 גיגה, ומגבילה את חלון ההקשר המקסימלי לכ־80 אלף טוקנים במקום 110 אלף. היא נועדה לשפר את מהירות יצירת הטקסט.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של 16 גיגה לפחות, כשהוא לא משמש לתצוגת מסך של מערכת ההפעלה. קובץ המודל תופס בין 12.7 ל־13.3 גיגה, תלוי בגרסה ובהפעלת מנגנון חיזוי מרובה טוקנים.

ללא הפעלת MTP אפשר לדחוף את ההקשר עד אזור 110 אלף טוקנים בזיכרון מלא, ועם MTP מגיעים לכ־80 אלף טוקנים. אם יש לכם כרטיס חלש יותר, או שכרטיס ה־16 גיגה מריץ גם את שולחן העבודה, עדיף להשתמש ב־API מרוחק כדי לא לקבל שגיאות חוסר זיכרון ברגע שההקשר יגדל מעבר לכמה אלפי טוקנים בודדים.

ollama run hf.co/Bucoid/Qwen3.8-27B-Heretic-Ara-16GB-VRAM-IQ4-XS-MTP-GGUF:IQ4_XS

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 39.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הקבצים, כולל שילוב במוצרים סגורים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים וציון השינויים שבוצעו בקוד או במשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗