GPT
Q

Qwen3-8B-FP8

קוד פתוח

Qwenapache-2.02025-04-28

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת שמונה מיליארד פרמטרים בכימות שמונה ביט שכוללת מתג מובנה בין מצב חשיבה עמוקה לשיחה רגילה. אתם מריצים אותו מקומית על כרטיס בודד בלי לחלק משאבים לשני מודלים שונים.

  • 8.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 8.8 GBמשקל הקבצים
  • 697,042הורדות בחודש

מה זה

המשקל הכולל יושב על שמונה נקודה שמונה גיגה בייט בזכות כימות שמונה ביט בבלוקים של מאה עשרים ושמונה. הוא מיועד לייצור טקסט ומגיע עם יכולת מובנית לעבור בין שני מצבי עבודה. במצב חשיבה הוא מייצר בלוק מחשבה בתוך תגיות ייעודיות לפתרון בעיות היגיון וקוד, ובמצב רגיל הוא מגיב ישירות כמו מודל שיחה רגיל כדי לחסוך זמן ומשאבי חישוב.

הוא כולל שלושים ושש שכבות ותמיכה מובנית בעשרות שפות לצד הפעלת כלים חיצוניים במבנה סוכנים. ברירת המחדל תומכת בהקשר של שלושים ושניים אלף טוקנים, אבל אפשר להרחיב אותו עד מאה שלושים ואחד אלף טוקנים באמצעות מנגנון הרחבה חיצוני אם המשימה דורשת מסמכים כבדים.

מתאים ל

  • סוכן אוטונומי להפעלת כלים

    הוא כולל תמיכה מובנית בחיבור לכלים חיצוניים ויודע לעבוד עם הגדרות ממשק בלי צורך במודל נפרד.

  • פתרון בעיות קוד במחשב מקומי

    מצב החשיבה נותן תהליך ניתוח מעמיק בתוך תגיות ייעודיות ונכנס לכרטיס מסך בודד בזכות כימות שמונה ביט.

  • בוט שיחה מהיר וחסכוני

    כיבוי מצב החשיבה מבטל את יצירת שלבי הביניים וחוסך זמני מענה בפניות שירות או כתיבה רגילה.

איפה זה נופל

אסור להשתמש בדגימה חמדנית במצב חשיבה, כי המודל נכנס ללולאות אינסופיות של חזרות ומאבד יציבות. אם תגדירו ענישה על חזרות ברמה גבוהה מדי, הוא מתחיל לערבב שפות בתוך אותה תשובה.

בעיה נוספת נוגעת להרחבת ההקשר. המנגנון הסטטי פוגע באיכות התשובות על טקסטים קצרים, ולכן לא כדאי להפעיל אותו אם הקלט שלכם קצר משלושים ושניים אלף טוקנים. בנוסף, בשיחות מרובות שלבים אתם חייבים לנקות את תוכן החשיבה מההיסטוריה ידנית אם המערכת שלכם לא משתמשת בתבנית המקורית.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך שולטים במצב החשיבה של המודל בזמן שיחה?

אפשר להגדיר את המשתנה מראש בקריאה לשרת כדי לקבוע אם המצב פעיל. כשמצב החשיבה דלוק, אפשר גם להכניס פקודות טקסט ישירות בהודעת המשתמש כדי לכבות ולהדליק אותו בין שלב לשלב בשיחה.

למה התשובות נהרסות כשאני מרחיב את חלון ההקשר?

השיטה להרחבת ההקשר מעבר לבסיס מופעלת באופן קבוע על כל האורכים ופוגעת בעיבוד של קלטים קצרים. מומלץ להפעיל את ההרחבה רק כשמנתחים קבצים ארוכים במיוחד ולהשאיר את ברירת המחדל לשיחות רגילות.

איך מריצים

אתם צריכים גרסה עדכנית של ספריית הטרנספורמרס, מגרסה ארבע נקודה חמישים ואחת ומעלה, אחרת תקבלו שגיאה על חוסר זיהוי של הארכיטקטורה. להרצה בשרת מקומי אפשר להרים אותו דרך מנועים כמו וי אל אל אם או אס ג'י לאנג, והם מייצרים נקודת קצה שתואמת למבנה המוכר של אופן איי איי.

המשקל שלו מאפשר להריץ אותו בקלות על כרטיס מסך ביתי חזק או שרת ענן פשוט עם כרטיס גרפי אחד. אם אתם מנסים לפרוס אותו על כמה כרטיסים ביחד דרך ספריית הבסיס, הכימות הספציפי הזה עושה בעיות ומחייב הגדרה של משתנה מערכת מיוחד לעצירת תהליכים במקביל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-8B-FP8")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש במודל למוצרים מסחריים, לשנות אותו, להריץ אותו על שרתים שלכם ולהפיץ עותקים שלו בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗