GPT
Q

Qwen3-Next-80B-A3B-Instruct-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02025-09-12

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • conversational

גרסת קוונטיזציה של מודל מומחים המפעיל 3 מיליארד פרמטרים מתוך 84 מיליארד בכל טוקן. הוא נועד למי שרוצה ביצועים ברמה גבוהה וחלון הקשר עצום, בלי להחזיק חוות שרתים ענקית.

  • 84Bפרמטרים
  • 262,144טוקנים בהקשר
  • 45.9 GBמשקל הקבצים
  • 34,252הורדות בחודש

מה זה

הארכיטקטורה של המודל משלבת שכבות מומחים עם שכבות קשב היברידיות, שכוללות מנגנון בשם Gated DeltaNet לצד קשב רגיל. מתוך 512 מומחים קיימים, רק עשרה מופעלים בכל רגע נתון בנוסף למומחה משותף אחד. השילוב הזה חותך דרסטית את כמות החישובים הדרושה ומאפשר מהירות תגובה גבוהה בהקשרים ארוכים, מבלי לוותר על נפח הידע של מודל גדול.

במבחני ביצועים הוא עוקף את הדורות הקודמים בקוד ובהיגיון. בבדיקת LiveCodeBench הוא קיבל ציון של 56.6 לעומת 51.8 של דגם הענק 235B, ובמבחן ההקשר RULER הוא שמר על 80.3 אחוזי דיוק באורך של מיליון טוקנים באמצעות הרחבת YaRN. זה אומר שבמשימות תכנות וניתוח טקסטים ארוכים הוא מתחרה ישירות בדגמים כבדים בהרבה.

מתאים ל

  • ניתוח מסמכים ארוכים

    תמיכה מובנית ביותר מ־260 אלף טוקנים מאפשרת לקרוא תיקי מסמכים מלאים וספרי קוד גדולים בבת אחת.

  • יצירת קוד וסקריפטים

    תוצאה של 56.6 במבחן LiveCodeBench מציבה אותו מעל מודלים כבדים בהרבה לצורכי פיתוח.

  • תשתיות שירות מהירות

    הפעלת שלושה מיליארד פרמטרים בלבד בכל טוקן מייצרת תגובות מהירות בעומסי עבודה גבוהים.

איפה זה נופל

המודל הזה מוגדר מראש לעבודה במצב הנחיות בלבד, ללא שלבי חשיבה פנימיים או תגיות ייעודיות. במשימות סוכן מורכבות הוא מציג חולשה ברורה, ובמבחן TAU2 Telecom הוא צנח לציון של 13.2 בלבד, חצי ממה שהשיג מודל 32B רגיל. בנוסף, שימוש בהרחבת הקשר YaRN עלול לפגוע באיכות התשובות בטקסטים קצרים.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך בודד?

לא בגרסה הזו. הקבצים שוקלים כמעט 46 גיגה בייט, וכדי להפעיל אותם יחד עם זיכרון הקשר סביר נדרשים לפחות שניים עד ארבעה כרטיסי מסך מקצועיים.

האם המודל כולל חשיבה עם תגיות?

לא. היצרן מציין במפורש שהמודל תומך רק במצב הנחיות רגיל ואינו מייצר בלוקים של חשיבה בפלט שלו.

איך מריצים

המשקל הכולל יושב על 45.9 גיגה בייט בזכות דחיסת AWQ של 4 ביט. כדי להריץ אותו עם חלון ההקשר המלא של 256 אלף טוקנים תצטרכו שרת עם 4 כרטיסי מסך, בדיוק כפי שממליצים בסקריפטים הרשמיים של vLLM או SGLang. אם אין לכם לפחות 64 עד 80 גיגה זיכרון וידאו פנוי, השרת פשוט יקרוס בעלייה.

אם אין לכם חומרה כזו זמינה מקומית, עדיף להשתמש בנקודת קצה מנוהלת בענן. למי שמריץ עצמאית, שימוש בפריימוורקים ייעודיים כמו SGLang מאפשר לנצל חיזוי מרובה טוקנים כדי להאיץ את מהירות הפליטה.

from transformers import pipeline

pipe = pipeline("text-generation", model="cyankiwi/Qwen3-Next-80B-A3B-Instruct-AWQ-4bit")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗