GPT
Q

Qwen3.6-27B-4bpw-16GB-VRAM

קוד פתוח

ggufbenchapache-2.02026-05-06

  • gguf
  • endpoints_compatible
  • imatrix
  • conversational

גרסת כימות מותאמת אישית של 27B שתוכננה לשבת בדיוק על כרטיס של 16GB. המטרה היא להריץ מודל היברידי חזק בלי לחרוג מהזיכרון או להקריב שכבות קשב קריטיות.

  • 12.6 GBמשקל הקבצים
  • 3,638הורדות בחודש
  • 59לייקים

מה זה

המודל הזה לוקח את ארכיטקטורת Mamba וטרנספורמר ההיברידית של Qwen3.6-27B ומכווץ אותה לדיוק ממוצע של 4.01 ביטים למשקל. במקום לחתוך את כל השכבות באותה צורה, מי שייצר אותו שמר על שכבות הקשב הטהורות ועל טנזורי הניתוב בדיוק גבוה יותר, ודחס חזק יותר את שכבות ה־SSM והרשתות הפנימיות העמידות. הרעיון הוא לנצל את אופי המבנה כדי למנוע הידרדרות בהסקה ארוכת טווח.

בבדיקות מול WikiText-2, המודל מציג Perplexity ממוצע של 7.128, בהשוואה ל־6.900 של מודל הבסיס. זה מעט פחות טוב מגרסאות ששוקלות מעל 4.25 ביטים, אבל הוא מגיע בנפח של 12.576 גיגה-בייט. הדחיסה הזו חוסכת בערך 750 מגה-בייט ביחס לחלופות, ומאפשרת לפנות מקום לקונטקסט בלי לפגוע בהתאמה למודל המקור שנשארת בקורלציה של 98.76 אחוזים.

מתאים ל

  • עבודה על כרטיס 16GB יחיד

    הוא מתוכנן לשבת בתוך 12.6 גיגה-בייט ולהשאיר מרווח לנשימה עבור זיכרון העבודה של הכרטיס.

  • הסקה מקומית מאוזנת

    חלוקת הדיוק שומרת על שכבות הקשב הטהורות בדיוק גבוה עבור משימות היגיון שמצריכות עיבוד עמוק.

  • סביבות ללא גישה לרשת

    מאפשר הרצה של מודל בגודל 27 מיליארד פרמטרים על חומרה מקומית סטנדרטית עם רישיון פתוח לחלוטין.

איפה זה נופל

החיסרון המרכזי מגיע ישירות מהדחיסה לרמת 4.01 ביטים. ה־Perplexity שלו גבוה יותר מכל שאר הגרסאות שנבדקו בטבלה, וההתאמה למילים הנבחרות המובילות של מודל המקור עומדת על 91.14 אחוז בלבד, שזה נמוך יותר מגרסאות IQ4 המקבילות. בנוסף, לא מדובר בפתרון קסם להקשרים אינסופיים על כרטיס של 16GB, כי ברגע שההקשר גדל, מרווח הזיכרון שנשאר יגרום לבעיות זליגה.

שאלות
נפוצות

האם המודל יעבוד על כרטיס מסך ביתי של 16GB בלי לגלוש לזיכרון הראשי?

כן, זו בדיוק המטרה שלשמה ייצרו אותו. המשקלים תופסים כ־12.57 גיגה-בייט, כך שנשארים לכם כ־3.4 גיגה-בייט פנויים ל־VRAM. עם זאת, אם תגדילו את חלון ההקשר יותר מדי, הזיכרון ייגמר והביצועים ייפגעו.

במה הכימות הזה שונה מגרסאות 4 ביט רגילות של אותו מודל?

היוצרים לא דחסו את כל המודל בצורה אחידה. שכבות הקשב והניתוב הרגישות נשמרו בדיוק גבוה, בעוד ששכבות ה־SSM וההזנה קוצצו באגרסיביות כדי להגיע לגודל סופי קטן בכ־6 אחוזים מגרסאות מקבילות.

איך מריצים

המודל מחולק לשלושה קבצים במשקל כולל של 12.6 גיגה-בייט, ומיועד מראש לכרטיסי מסך צרכניים עם 16GB של VRAM. כשהמשקלים יושבים על קצת יותר מ־12.5 גיגה-בייט, נשאר לכם מרווח של כשלושה גיגה-בייט להקשר ולמערכת ההפעלה.

אם יש לכם כרטיס עם 12GB או פחות, הוא לא ייכנס לשם במלואו ויגלוש ל־RAM הרגיל, מה שיחנוק את מהירות היצירה. במקרים כאלה, או כשצריך חלונות הקשר עצומים שדורשים זיכרון עבודה כבד ל־KV cache, עדיף לפנות ל־API חיצוני ולא לנסות לדחוף אותו בכוח לכרטיס חלש.

ollama run hf.co/ggufbench/Qwen3.6-27B-4bpw-16GB-VRAM:Qwen3.6-27B-4bpw-16GB-VRAM

הקבצים

3 קבצים במאגר, 12.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם יכולים להשתמש בו ליישומים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים פרטיים בלי תשלום תמלוגים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית וצירוף עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗