GPT
Q

QwQ-32B-AWQ

קוד פתוח

Qwenapache-2.02025-03-05

  • safetensors
  • qwen2
  • chat
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת 4 ביט של מודל החשיבה מבית Qwen שנועדה להתחרות בביצועי DeepSeek-R1 ו־o1-mini. מקבלים יכולת פתרון בעיות מורכבות בחבילה שנכנסת למאיץ בודד.

  • 33Bפרמטרים
  • 40,960טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 21,570הורדות בחודש

מה זה

מדובר במודל שמכוון ישירות למשימות היגיון ופתרון בעיות קשות, כשהוא מייצר תהליך חשיבה מובנה לפני התשובה הסופית. המפתחים מציבים אותו ראש בראש מול מודלים מובילים כמו DeepSeek-R1 ו־o1-mini, כאשר היתרון המרכזי כאן הוא שמדובר במשקל בינוני של כ־32.5 מיליארד פרמטרים שזמין במשקלי AWQ מכווצים.

הארכיטקטורה מבוססת על סדרת Qwen2.5 עם 64 שכבות, מנגנון GQA ואימון מתקדם שכולל חיזוק בלמידה. הגרסה הזו מכווצת ל־4 ביט, מה שמוריד את נפח הקבצים לכ־18 ג'יגה בייט ופותח אפשרות להרצה מקומית בלי לרוקן את תקציב השרתים.

מתאים ל

  • פתרון בעיות מתמטיקה

    מייצר תהליך חשיבה שלב אחר שלב ומחזיר פתרונות מובנים בפורמט מוגדר מראש.

  • מענה לשאלות ברירה מרובה

    יודע לנתח את השאלה לעומק ולהחזיר תשובה נקייה במבנה JSON מוכן לשליפה.

  • משימות חשיבה על חומרה מקומית

    מספק יכולות reasoning של מודלים ענקיים על גבי כרטיס תצוגה יחיד בזכות כיווץ AWQ.

איפה זה נופל

המודל נוטה להיכנס לחזרות אינסופיות אם לא מגדירים פרמטרים של נוכחות ודגימה מדויקת. העלאה חדה של ענישת נוכחות כדי לפתור את הבעיה הזו עלולה לגרום לערבוב שפות ולירידה באיכות התשובות. בנוסף, חלון ההקשר דורש התעסקות ידנית בהגדרות ברגע שעוברים 8,192 טוקנים, והרצה כזו עלולה לשחוק את הדיוק עבור פרומפטים קצרים.

אותה משפחה

QwQ יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מונעים מהמודל להיתקע בלולאות של טקסט חוזר?

יש לעבוד עם דגימה בטמפרטורה 0.6, TopP של 0.95 ו־TopK בטווח שבין 20 ל־40. במערכות תומכות אפשר להעלות מעט את ערך ענישת הנוכחות עד 2, אך זהירות נדרשת כי ערך גבוה מדי יוביל לפגיעה באיכות ולערבוב שפות.

האם צריך לשמור את בלוק החשיבה בהיסטוריית השיחה?

לא. ההנחיה היא לנקות את תגיות החשיבה משיחות קודמות ולהשאיר רק את התשובה הסופית. המודל צריך תגית חשיבה נקייה רק בתחילת הפקת התשובה הנוכחית כדי לתפקד היטב.

איך גורמים לו לעבוד עם טקסטים ארוכים במיוחד?

כאשר עוברים את רף 8,192 הטוקנים יש להפעיל את מנגנון YaRN על ידי הגדרת מקדם מתיחה 4.0 בקובץ הקונפיגורציה. שימו לב שבשימוש במנוע vLLM המתיחה הזו היא סטטית, מה שעלול להוריד את הביצועים אם תריצו משימות קצרות במקביל.

איך מריצים

המשקל הכולל יושב על 18 ג'יגה בייט, כך שכרטיס מסך בודד עם 24 ג'יגה זיכרון יכול להחזיק אותו לעבודה בסיסית, בתנאי שלא מעמיסים חלון הקשר ענקי. להרצה מעשית מומלץ להשתמש ב־vLLM או ישירות דרך ספריית transformers העדכנית מגרסה 4.37 ומעלה, כי גרסאות ישנות יותר פשוט יזרקו שגיאה על חוסר תמיכה בארכיטקטורה.

המפתח ממליץ לעבוד עם דגימה של טמפרטורה 0.6 ולא פענוח חמדן כדי שהמודל לא ייכנס ללולאות אינסופיות. אם הקלט שלכם עובר 8,192 טוקנים, תצטרכו להגדיר YaRN בקובץ הקונפיגורציה, אבל שימו לב שב־vLLM המנגנון הזה סטטי ועלול לפגוע בביצועים בטקסטים קצרים.

pip install -U huggingface_hub
hf download Qwen/QwQ-32B-AWQ

הרישיון

הפרויקט משוחרר ברישיון apache-2.0, שמאפשר שימוש חופשי לגמרי גם לפרויקטים מסחריים וגם למחקר. מותר לשנות את הקוד, לשלב אותו במוצרים פנימיים או פתוחים, ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗