GPT
Q

Qwen3.6-28B-REAP20-A3B-GGUF

קוד פתוח

barozpapache-2.02026-04-18

  • gguf
  • qwen3
  • text-generation
  • moe
  • pruning

גרסת GGUF מכווצת של Qwen3.6 שעברה דילול מומחים כדי לחסוך מקום בלי להאט את הריצה. אתם מקבלים מודל של עשרים ושמונה מיליארד פרמטרים שרץ בפועל כמו מודל קטן בהרבה.

  • 229 GBמשקל הקבצים
  • 7,606הורדות בחודש
  • 76לייקים

מה זה

הבסיס כאן הוא ארכיטקטורת תערובת מומחים שמשלבת מנגנון Gated DeltaNet. במקור המודל החזיק 256 מומחים, אבל בעזרת שיטת REAP הסירו ממנו עשרים אחוז מהם, כלומר נותרו 205 מומחים. בזמן אמת פעילים רק 8 מומחים לכל טוקן, כך שעומס החישוב בפועל שקול למודל של כשלושה מיליארד פרמטרים בלבד.

התוצאה של הדילול הזה היא גודל קובץ קטן יותר בכעשרים וחמישה אחוזים לעומת המודל המקורי, תוך נרמול משקולות הניתוב כדי לשמור על היכולות הקיימות. המפתח מדווח על ביצועים תחרותיים במשימות קוד, חשיבה והסקה לוגית, לצד חלון הקשר של עד 262,144 טוקנים שמתאים לעיבוד טקסטים ארוכים.

מתאים ל

  • שרת מקומי לפיתוח קוד

    הוא מפעיל רק שלושה מיליארד פרמטרים לטוקן ומספק מהירות מענה גבוהה על חומרה מקומית סבירה.

  • ניתוח מסמכים ארוכים

    חלון הקשר של מעל 260 אלף טוקנים מאפשר לעבד קבצים גדולים בלי לחתוך אותם מראש.

  • הטמעה במוצר קצה מסחרי

    רישיון אפאצ'י חופשי מאפשר להריץ אותו ישירות אצל הלקוח בלי תלות ברשת או ספק חיצוני.

איפה זה נופל

הקיצוץ של 51 מומחים לכל שכבה נועד לחסוך מקום, אבל הוא בלתי הפיך. לא משנה כמה מנרמלים את משקולות הניתוב, המודל איבד חמישית מהנפח המקורי שלו ויכול ליפול במקרי קצה שדרשו את הידע שנחתך. בכרטיס המודל אין מדדים מספריים ספציפיים על ירידת הדיוק לעומת המקור, כך שתצטרכו לבדוק בעצמכם את הפלט לפני שאתם סומכים עליו. בנוסף, השפה המוגדרת היא אנגלית בלבד, וגרסאות הכיווץ הנמוכות ביותר כמו Q2_K ידועות בפגיעה מורגשת באיכות התשובות.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי רגיל של 16 גיגה בייט?

קובץ ה־Q4 המומלץ שוקל כ־17 גיגה בייט ולכן ידרוש לפחות 20 גיגה בייט זיכרון כדי להיכנס במלואו. אפשר לפצל חלק מהשכבות לזיכרון העבודה של המחשב, או לחלופין לרדת לגרסאות דחוסות יותר כמו Q3 או IQ3_XXS ששוקלות בין 12 ל־15 גיגה בייט.

מה ההבדל המרכזי בינו לבין המודל המקורי של Qwen?

הגרסה הזו עברה הסרה יזומה של עשרים אחוז מהמומחים באמצעות שיטת REAP. זה הוריד את משקל המודל הכולל בכעשרים וחמישה אחוזים ואפשר לדחוס אותו לקובצי GGUF קלים יותר, בזמן שמהירות החישוב נותרה דומה כיוון שמספר המומחים הפעילים בכל רגע לא השתנה.

איך מריצים

בשביל להריץ את גרסת Q4_K_M המומלצת ששוקלת 17 גיגה בייט תצטרכו לפחות 20 גיגה בייט של זיכרון כרטיס מסך כדי לטעון הכל לכרטיס. אם אין לכם כרטיס מתאים, אפשר לפצל בין עשרה גיגה בייט זיכרון כרטיס מסך לעשרה גיגה בייט זיכרון עבודה רגיל, או להריץ על המעבד בלבד עם 24 גיגה בייט זיכרון מערכת ומעלה.

ההבדלים בין הגרסאות נעים מקבצי BF16 כבדים של 56.5 גיגה בייט ועד גרסאות דחוסות מאוד כמו Q2_K בגודל 11 גיגה בייט שמאבדות מאיכות הפלט. ההרצה נעשית דרך llama.cpp, שרת מקומי, או כלים שולחניים כמו LM Studio ו־Ollama.

ollama run hf.co/barozp/Qwen3.6-28B-REAP20-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם רשאים להשתמש בו ליישומים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו בתוך מוצרים סגורים בלי לשלם תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים המקורית וצירוף עותק של הרישיון בכל הפצה של התוכנה או הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗