GPT
Q

QwQ-32B

קוד פתוח

Qwenapache-2.02025-03-05

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

מודל הסקת מסקנות בגודל 32 מיליארד פרמטרים שמתחרה בדגמים סגורים. הוא מייצר תהליך חשיבה מפורט לפני מתן תשובה לפתרון בעיות קשות.

  • 33Bפרמטרים
  • 40,960טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 74,576הורדות בחודש

מה זה

מדובר במודל שמתמקד בחשיבה והסקה לוגית, ולא בעוד מודל שיחה רגיל. הוא אומן מראש ולאחר מכן עבר כוונון ייעודי ולמידת חיזוק, במטרה להתמודד מול מודלים מובילים בתחום כמו DeepSeek-R1 ו־o1-mini. במקום לתת מענה מידי, הוא יוצר בלוק חשיבה פנימי שבו הוא מנתח את האפשרויות, פוסל שגיאות ומנסח את התשובה הסופית. המבנה שלו מבוסס על ארכיטקטורת Qwen2.5 עם 64 שכבות ושימוש ב־Grouped Query Attention לייעול משאבי הזיכרון.

ההבדל המרכזי מול מודלים רגילים באותו סדר גודל הוא המיקוד בבעיות מורכבות במתמטיקה, בקוד ובמדעים. הוא דורש הגדרות דגימה מדויקות כדי לעבוד בצורה תקינה, וחלון ההקשר שלו נמתח עד 131,072 טוקנים באמצעות מנגנון YaRN. עם זאת, ברירת המחדל עומדת על הקשר קצר יותר, ומי שרוצה לנצל את מלוא האורך נדרש להתאמות קונפיגורציה ידניות בתשתית ההרצה.

מתאים ל

  • פתרון בעיות מתמטיקה

    היכולת לפרק חישובים מורכבים בתוך תגי חשיבה סגורים מבטיחה דיוק גבוה בתוצאה הסופית.

  • ניתוח ואיתור באגים בקוד

    המודל בוחן שורות קוד לעומק ומדמה תהליכי הרצה לפני שהוא מציע תיקון לבעיה.

  • פתרון שאלות רב-ברירה מדעיות

    הבנת שאלות מורכבות תוך אילוץ הפלט למבנה נתונים מוגדר היטב לפי הנחיות הכרטיס.

איפה זה נופל

המודל נוטה להיתקע בלולאות אינסופיות של חזרות אם משתמשים בפענוח חמדני ולא מקפידים על הגדרות דגימה כמו TopP ו־TopK. העלאת מקדם ה־presence penalty אמנם מרסנת את הלולאות, אך עלולה לגרום לערבוב שפות ולפגיעה קלה בביצועים. בנוסף, הפעלת YaRN לצורך הרחבת ההקשר מעל 8,192 טוקנים עלולה לפגוע בדיוק הטקסטים הקצרים תחת vLLM עקב מגבלות מימוש סטטי. כמו כן, תגי החשיבה מייצרים תקורת טוקנים גבוהה מאוד ומאטים משמעותית את זמן המענה.

אותה משפחה

QwQ יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא. המודל שוקל 61 גיגה בייט בדיוק המקורי ודורש חומרת שרתים עם כרטיסי מסך מתקדמים בנפח של עשרות גיגה בייט. ללא כרטיס מקצועי, המערכת תיפול מיד מחוסר זיכרון.

איך מונעים מהמודל לחזור על עצמו ללא סוף?

חייבים להגדיר טמפרטורה סביב 0.6 ולשלב TopP של 0.95 יחד עם TopK. שימוש ב־Greedy decoding מביא לחזרות אינסופיות שפוגעות לחלוטין בפלט.

האם כדאי להפעיל את YaRN כברירת מחדל?

לא מומלץ להפעיל אותו לטקסטים קצרים. ההרחבה נחוצה רק לפרומפטים מעל 8,192 טוקנים, ובמסגרות כמו vLLM היא עלולה לפגוע באיכות התשובה בטקסטים קצרים.

איך מריצים

המשקל הגולמי בדיוק מלא עומד על 61 גיגה בייט, כך שצריך לפחות שני כרטיסי A100 של 40 גיגה או כרטיס בודד של 80 גיגה כדי להריץ אותו בלי כימות. אם משתמשים בספריית transformers, חובה לוודא שהגרסה היא 4.37.0 ומעלה כדי לתמוך בארכיטקטורה. מפתחי המודל ממליצים על vLLM להרצה בייצור, יחד עם טמפרטורה של 0.6 וערכי דגימה ספציפיים שמונעים לולאות חזרתיות.

אם אין לכם שרת ייעודי זמין, קריאה לשירות ענן קיימת כחלופה זולה בהרבה. החומרה הדרושה יקרה, במיוחד כשהמודל מייצר אלפי טוקנים של חשיבה לכל שאלה ומעמיס על כרטיסי המסך.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/QwQ-32B")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקולות והפצה חופשית בתוך מוצרים. התנאים העיקריים דורשים שמירה על הודעת זכויות היוצרים וצירוף עותק הרישיון המקורי, בלי חובה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗