GPT
Q

Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller

קוד פתוח

jrellרישיון לא דווח2026-08-15

  • gguf
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קוונטיזציה היברידית ל־Qwen3.8-27B שנועדה להידחס לתוך כרטיסי מסך של 16GB. היא שומרת על יכולות ההיגיון והקוד תוך כיווץ הזיכרון הכללי כדי לאפשר הקשר ארוך.

  • 12.6 GBמשקל הקבצים
  • 35,609הורדות בחודש
  • 77לייקים

מה זה

המודל הזה לוקח את גרסת 27B של Qwen ומכווץ אותה בצורה לא אחידה כדי לחסוך מקום בזיכרון הגרפי. שכבות ה־Attention, שאחראיות על היגיון, כתיבת קוד ועיצוב פלט, נשמרות ברמת IQ4_XS. לעומת זאת, שכבות ה־FFN נדחסות לרמה נמוכה יותר של IQ3_S כדי לחתוך את המשקל הכולל לרמה של כ־13.5GB בקובצי GGUF.

השילוב הזה מאפשר לנצל את הזיכרון שנשאר בכרטיס לטובת מנגנון Multi-Token Prediction והקשר ארוך. בבדיקות של המפרסם על כרטיס נייד מסוג RTX 5080, המערכת הגיעה למהירות של 50 טוקנים לשנייה עם הקשר של 64k בשילוב MTP, או 30 טוקנים לשנייה עם הקשר של 128k ללא MTP.

מתאים ל

  • פיתוח קוד מקומי ב־16GB

    שכבות ההיגיון נשמרו באיכות טובה כדי לאפשר כתיבת קוד ופתרון בעיות על כרטיסי מסך צרכניים.

  • ניתוח מסמכים ארוכים

    הדחיסה משאירה מספיק VRAM כדי לפתוח חלון הקשר של עד 128k בלי לגלוש לזיכרון המערכת.

  • הסקה מהירה עם MTP

    החיסכון בנפח מאפשר להפעיל חיזוי מרובה טוקנים שמגיע לעד 50 טוקנים לשנייה בחומרה מתאימה.

איפה זה נופל

הכיווץ האגרסיבי של שכבות ה־FFN פוגע בידע הכללי של המודל וביכולת השליפה מהקשר ארוך. המפתח מציין במפורש שאם המטרה היא כתיבה יצירתית, עדיף להשתמש בגרסת IQ4_XS רגילה ולא בגרסה ההיברידית הזו. בנוסף, מדובר במודל בסיס שעבר דחיסה קהילתית, כך שחובה לבדוק התנהגות מול פרומפטים מורכבים לפני שמסתמכים עליו.

שאלות
נפוצות

למה לא להוריד פשוט גרסת IQ4_XS רגילה?

גרסה רגילה תופסת יותר נפח ולא תשאיר מספיק מקום בתוך כרטיס של 16GB עבור הקשר ארוך של 64k או 128k ומנגנון MTP. אם אתם עובדים עם הקשרים קצרים או צריכים ידע כללי רחב וכתיבה יצירתית, הגרסה הרגילה באמת תתאים לכם יותר.

האם המודל ירוץ היטב על מעבד ללא כרטיס מסך?

הוא נבנה ספציפית כדי לנצל זיכרון VRAM של כרטיסי מסך צרכניים מהירים. הרצה על גבי מעבד וזיכרון RAM רגיל אפשרית טכנית דרך llama.cpp, אבל תאבדו את יתרון המהירות של MTP וקצב הטוקנים יצנח משמעותית בהקשרים ארוכים.

איך מריצים

מריצים אותו ישירות דרך llama.cpp, שממנו הוא קומפל במקור באמצעות iMatrix ייעודי. כדי להריץ אותו מקומית עם כל ההקשר והפיצ'רים תצטרכו כרטיס עם 16GB זיכרון לפחות, כמו RTX 4080 או RTX 5080.

אם אין לכם חומרה כזו עם 16GB VRAM פנויים, או אם אתם לא חייבים הקשר של עשרות אלפי טוקנים ומנגנון MTP מקומי, כנראה יהיה זול ופשוט יותר לפנות ל־API חיצוני שמריץ את המודל המלא.

ollama run hf.co/jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller:IQ4_XS

הקבצים

3 קבצים במאגר, 12.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של הקובץ לא דווח בעמוד המודל. מבחינה משפטית, כשאין רישיון מוגדר אסור להניח שניתן להשתמש בו במוצר מסחרי, וזה דורש בירור מול תנאי השימוש של מודל הבסיס של Qwen לפני שילוב שלו בפרויקט.

הרישיון המלא בעמוד המודל ↗