GPT
Q

Qwen3-Coder-Next-FP8-Dynamic

קוד פתוח

unslothapache-2.02026-02-03

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • unsloth

גרסת קוונטיזציה דינמית במבנה תערובת מומחים שמפעילה רק 3 מיליארד פרמטרים מתוך 80 מיליארד. מתאימה למי שרוצה להריץ סוכן פיתוח עצמאי עם חלון של 256 אלף טוקנים.

  • 80Bפרמטרים
  • 262,144טוקנים בהקשר
  • 77.7 GBמשקל הקבצים
  • 2,916הורדות בחודש

מה זה

המודל הזה בנוי על ארכיטקטורת תערובת מומחים קיצונית של 512 מומחים, כאשר בכל ריצה פועלים רק 10 מומחים רגילים ומומחה משותף אחד. השילוב הזה נותן גודל כולל של 80 מיליארד פרמטרים, אבל זמן החישוב בפועל מקביל למודל קטן של 3 מיליארד פרמטרים בלבד.

המבנה הפנימי שלו משלב שכבות ליניאריות מסוג דלתה נט יחד עם שכבות קשב רגילות כדי להתמודד עם חלון הקשר המלא של 262,144 טוקנים. הוא אומן ישירות להפעלת כלים, השתלבות בסביבות פיתוח כמו קלוד קוד או קליין, והתאוששות משגיאות ריצה של קוד בזמן אמת.

מתאים ל

  • סוכן תיקון שגיאות בקוד

    הוא יודע להריץ בדיקות, לתפוס קריסות ריצה ולתקן את הקוד ישירות מול כלי פיתוח חיצוניים.

  • ניתוח בסיסי קוד ענקיים

    חלון הקשר של מאתיים חמישים ושש אלף טוקנים מתאים לטעינת ספריות שלמות ומסמכי ארכיטקטורה יחד.

  • שרת כלים תואם אופן איי איי

    הוא כולל תמיכה מובנית בקריאות לפונקציות דרך שרתי הסקה סטנדרטיים.

איפה זה נופל

המודל תומך רק במצב פעולה רגיל ללא שלבי חשיבה פנימיים, ולא מייצר בלוקים של תהליך מחשבה בפלט שלו. בנוסף, חלון ההקשר המלא של 256 אלף טוקנים הוא נקודת תורפה ברורה של מחסור בזיכרון בזמן הרצה, מה שמחייב לעיתים קרובות לחתוך את ההקשר כדי שהשרת בכלל יעלה. חייבים לבדוק את התנהגות המודל בהקשרים מקוצרים לפני שמשלבים אותו בזרימת עבודה אמיתית.

שאלות
נפוצות

האם המודל חושב ומסביר לעצמו את הדרך לפני כתיבת הקוד?

לא. המודל פועל במפורש במצב נטול חשיבה בלבד, ולא מייצר תגיות חשיבה כלל. הוא פולט ישירות את התשובה או את הקריאה לכלי.

מה היתרון של גרסת השמונה ביט הדינמית הזו לעומת הגרסה הרגילה?

הקוונטיזציה הדינמית מנסה לשמר את הדיוק של המודל המקורי תוך שמירה על משקל קבצים של 77.7 ג'יגה בייט. היא דורשת פחות משאבי זיכרון בהשוואה למשקלים מלאים.

איך מריצים

כדי להריץ אותו מקומית בגרסת השמונה ביט הדינמית הזו, תצטרכו לאחסן 77.7 ג'יגה בייט של קבצים בזיכרון הווידאו. זה דורש שרתי עיבוד ייעודיים עם כרטיסי מסך מרובים, למשל מערך של לפחות שניים עד ארבעה מעבדים גרפיים חזקים, תוך שימוש במנועים כמו וי אל אל אם או אס ג'י לאנג.

אם שרת ההסקה נתקל בחוסר זיכרון, ההמלצה הישירה של המפתחים היא לחתוך את חלון ההקשר ממאתיים חמישים ושש אלף לשלושים ושניים אלף טוקנים. למפתח בודד בלי חומרת שרת כבדה, פריסה עצמית כזו תהיה יקרה וכבדה מדי לעומת צריכה דרך שירות ענן חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Qwen3-Coder-Next-FP8-Dynamic")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים פנימיים או חיצוניים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗