GPT
Q

Qwen3.8-Flash-Next

קוד פתוח

Qwenother2026-08-24

  • transformers
  • safetensors
  • qwen4_exp
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל שפה וראייה שמשלב גודל עצום עם ארכיטקטורה שמפעילה רק 6 מיליארד פרמטרים בכל שלב. הוא מיועד למי שמחפש ביצועי סוכנים חזקים בלי לשלם את מחיר החישוב של מודל ענק.

  • 180Bפרמטרים
  • 262,144טוקנים בהקשר
  • 335 GBמשקל הקבצים
  • 503,263הורדות בחודש

מה זה

מדובר במבט ראשון על הארכיטקטורה הניסיונית של הדור הבא מבית יוצרי קוון. המבנה שלו מורכב מ־125 מיליארד פרמטרים של מודל הבסיס שמתוכם רצים רק 6 מיליארד בכל טוקן, לצד שכבת הטמעות ייחודית של עוד 51 מיליארד פרמטרים שמבוססת על מקטעי מילים קצרים. החיבור הזה מאפשר להחזיק ידע נרחב מאוד בחומרה בלי לחנוק את המעבד בחישובי כפל מטריצות כבדים.

במבחני התוכנה והסוכנים הוא מציג מספרים מרשימים ביחס לגודל הפעיל שלו. במבחני פיתוח תוכנה כמו סווי בנץ' מולטילינגואל הוא מגיע ל־81 אחוז, ובמשימות מורכבות של סביבת עבודה והפעלת כלים הוא עוקף מודלים כבדים בהרבה. המבנה ההיברידי של מנגנון הקשב מאיץ את זמני התגובה בטקסטים ארוכים, מה שהופך אותו לרלוונטי במיוחד לסוכנים אוטונומיים שצריכים לרוץ בלולאות עבודה ממושכות.

מתאים ל

  • סוכני פיתוח תוכנה

    הוא משיג תוצאות גבוהות במיוחד במבחני תכנות מרובי שפות ומתאים לתיקון באגים עצמאי.

  • אוטומציה והפעלת כלים

    הארכיטקטורה שלו מותאמת לריצה מהירה של קריאות חוזרות לכלים חיצוניים בלי השהיות כבדות.

  • ניתוח מסמכים ארוכים

    מנגנון הקשב הדליל מקצר זמני עיבוד בטקסטים ארוכים של מאות אלפי טוקנים ומאפשר תחקור מהיר.

איפה זה נופל

למרות ההצלחה במשימות קוד עצמאיות, במבחן יצירת קוד ברמת מאגר שלם הוא קיבל 48.1 נקודות, תוצאה שנמוכה מזו של דיפסיק וי 4 פלאש. בנוסף, במבחן הסוכנים הקשה אג'נטס לאסט אקזם הוא פתר רק 24.3 אחוז במכה ראשונה. הארכיטקטורה הניסיונית עדיין חדשה, ולכן כדאי לבדוק היטב את אמינות הפלט במשימות רב שלביות לפני שסומכים עליו בעיניים עצומות.

אותה משפחה

Qwen3.8-Flash-Next יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך בודד?

לא. משקל הקבצים עומד על 335 ג'יגה בייט, כך שאי אפשר לטעון אותו ללא מערך שרתים מרובה כרטיסי זיכרון גבוהים. לשימוש מקומי במחשב רגיל הוא פשוט גדול מדי.

איך הוא מצליח להיות מהיר יחסית למודל של מעל מאה מיליארד פרמטרים?

הוא מפעיל בכל רגע נתון רק 6 מיליארד פרמטרים מתוך המודל, ומסתמך על שכבת הטמעות ייחודית ומנגנון קשב חסכוני. זה מאפשר לחסוך זמן חישוב יקר מבלי לאבד את קיבולת הידע הכללית.

איך מריצים

כדי להריץ אותו מקומית תצטרכו תשתית שרתים רצינית של כמה מאיצים גרפיים חזקים, שכן הקבצים תופסים לבדם 335 ג'יגה בייט בזיכרון. המודל נתמך בספריות כמו וי אל אל אם או אס ג'י לאנג, אבל דורש ניהול זיכרון מוקפד בגלל שכבת ההטמעות הגדולה.

אם אתם לא מחזיקים אשכול של חומרת שרתים מתאימה, עדיף להשתמש ישירות בשירות הענן הרשמי של היוצרים. גרסת הענן כוללת חלון הקשר מורחב של מיליון טוקנים וכלים מוכנים מראש, וחוסכת את ההתעסקות המסובכת בחלוקת המשקלים בין כרטיסים שונים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-Flash-Next")
print(pipe("שלום"))

הקבצים

144 קבצים במאגר, 335 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כאחר ואינו רישיון קוד פתוח סטנדרטי מוכר. המשמעות היא שאתם חייבים לבדוק את תנאי השימוש הפרטניים בקבצי המקור לפני שילוב שלו במערכת מסחרית, כדי לוודא שאין מגבלות על שימוש מסחרי או הפצה ללקוחות.

הרישיון המלא בעמוד המודל ↗