GPT
Q

Qwen3-Coder-Next-REAP-48B-A3B-GGUF

קוד פתוח

lovedheartapache-2.02026-02-04

  • gguf
  • text-generation-inference
  • endpoints_compatible
  • conversational

גרסה מכווצת למודל קוד שמפעילה רק שלושה מיליארד פרמטרים מתוך 48 בפועל. מתאים למי שרוצה מהירות של מודל קטן עם זיכרון וידע של מודל ענק.

  • 296 GBמשקל הקבצים
  • 1,429הורדות בחודש
  • 49לייקים

מה זה

מדובר במודל שפה לתכנות שמבוסס על ארכיטקטורת תערובת מומחים, MoE, עם שילוב בין שכבות DeltaNet לשכבות קשב רגילות. המבנה המקורי כלל 512 מומחים, אך היוצר חתך 40% מהם בשיטת REAP והשאיר 308 מומחים בלבד. בזמן ריצה פעילים רק 10 מומחים לצד מומחה משותף אחד, מה שמאפשר להריץ מעט מאוד חישובים בכל טוקן.

חלון ההקשר המקורי עומד על 262,144 טוקנים, נתון עצום שמאפשר לבלוע מאגרי קוד שלמים בבת אחת. הדוגמאות שהועלו מציגות אותו מתמודד עם משימות סוכן כמו שכפול ריפו של llama.cpp וסקירת Pull Request, וגם כתיבת קוד פרונטאנד מורכב ב־Three.js מאפס.

מתאים ל

  • סקירת קוד ב־PR

    קריאת שינויים מורכבים במאגר וניתוח שגיאות בזכות חלון הקשר הענק והיכולת לפעול כסוכן אוטונומי.

  • פיתוח גרפיקה ב־Three.js

    יצירת אנימציות, מערכות חלקיקים ושיידרים לפי מפרט טכני מפורט בלי לאבד את הקונטקסט.

  • עבודה מקומית מהירה

    קבלת השלמות קוד במהירות גבוהה יחסית לגודל המודל, בזכות הפעלה של שלושה מיליארד פרמטרים בלבד.

איפה זה נופל

החיתוך האגרסיבי של 40% מהמומחים באמצעות REAP חוסך מקום, אבל כרטיס המודל לא מציג שום מבחן ביצועים מספרי שמשווה אותו למקור. לא ברור כמה דיוק אבד בדרך, במיוחד בלוגיקה מורכבת של תכנות או בשפות פחות נפוצות. בנוסף, חלון הקשר של 262K דורש משאבי זיכרון אדירים ל־KV cache, כך שקשה מאוד לנצל את כולו בפועל על חומרה מקומית בלי לקבל שגיאות זיכרון.

שאלות
נפוצות

איך מודל של 48B דורש רק 3B פרמטרים בכל פעולה?

הוא בנוי בשיטת MoE, שבה המודל מחולק למאות מומחים קטנים. בכל טוקן מופעלים רק עשרה מומחים ספציפיים ומומחה משותף אחד, כך שכוח החישוב בפועל שווה למודל קטן בהרבה.

כמה זיכרון צריך כדי להריץ את המודל הזה?

זה תלוי בכימות. כדי להחזיק את כל המשקלים בזיכרון תצטרכו בין 30 ל־60 גיגה בייט בגרסאות מכווצות, והרבה יותר בגרסאות מלאות, לא כולל הזיכרון הנדרש להקשר הארוך.

איך מריצים

הקבצים בפורמט GGUF שוקלים יחד 296 גיגה בייט ומחולקים ל־14 קבצים. כדי להריץ את הגרסאות הכבדות כמו Q8_0 תצטרכו שרת עם כמה כרטיסי מסך חזקים או כמות עצומה של זיכרון RAM מאוחד, כי המשקל הכללי לא נכנס בכרטיס ביתי רגיל.

אם אתם רצים על חומרה צנועה יותר, גרסת Q4_K_XL תדרוש פחות זיכרון ותרוץ מהר יותר בזכות 3 מיליארד הפרמטרים הפעילים בלבד. עדיין, אם אין לכם תחנת עבודה ייעודית עם עשרות גיגה בייט של זיכרון פנוי, עדיף להשתמש ב־API מרוחק במקום להסתבך עם הורדת מאות גיגות.

ollama run hf.co/lovedheart/Qwen3-Coder-Next-REAP-48B-A3B-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש, גם במוצרים סגורים. התנאי העיקרי הוא שמירת הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗