GPT
Q

QwQ-32B-GGUF

קוד פתוח

Qwenapache-2.02025-03-05

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

זהו מודל חשיבה בגודל בינוני שמיועד לפתרון בעיות מורכבות. הוא מביא ביצועי היקש ברמה של מודלים ענקיים לקבצי GGUF שאפשר להריץ על חומרה מקומית.

  • 180 GBמשקל הקבצים
  • 16,957הורדות בחודש
  • 212לייקים

מה זה

מדובר בגרסת GGUF של מודל ההיקש מבית Qwen, המבוסס על ארכיטקטורת Qwen2.5 עם 32.5 מיליארד פרמטרים. בשונה ממודלים רגילים שעברו רק כוונון להוראות, הוא עבר אימון מבוסס חיזוקים ומייצר תהליך חשיבה מפורט לפני שהוא פולט תשובה סופית. היכולת הזו מאפשרת לו להתמודד עם אתגרים קשים במתמטיקה ולוגיקה, כשהמפתחים מציגים ביצועים שמתחרים ישירות במודלים כמו DeepSeek-R1 ו־o1-mini.

הוא תומך בחלון הקשר מלא של עד 131,072 טוקנים, אם כי יש מגבלות טכניות בפורמט הזה. המאגר כולל מגוון קוונטיזציות, ביניהן q4_K_M, q5_0, q5_K_M, q6_K ו־q8_0, כך שאפשר לבחור את נקודת האיזון המתאימה בין איכות התשובות ודרישות הזיכרון.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מתוכנן לחשוב צעד אחר צעד ולפלוט תשובות מנומקות במבנה לוגי מוגדר היטב.

  • מענה על שאלות רב-ברירה

    מנגנון הנימוק שלו מאפשר ניתוח מעמיק של שאלות מורכבות לפני בחירת התשובה הנכונה בפורמט JSON.

  • היקש לוגי לוקאלי

    מתאים למי שחייב מודל ברמת ביצועים של o1-mini אבל דורש הרצה מקומית ומאובטחת בלי גישה לרשת.

איפה זה נופל

המודל דורש כוונון פרמטרים עדין מאוד. אסור להשתמש בפיענוח חמדן כי הוא נכנס ללולאות חזרתיות אינסופיות, ומחייב הגדרת טמפרטורה של 0.6 ודגימת TopP ו־TopK. בנוסף, אם תעלו את ה־presence penalty כדי להילחם בחזרתיות, הוא עלול לערבב שפות בטקסט ולסבול מירידה בביצועים.

בשיחות מרובות שלבים אתם חייבים למחוק את תהליך החשיבה מהיסטוריית השיחה ולהשאיר רק את התשובה הסופית, אחרת האיכות נפגעת. נקודה קריטית נוספת היא שרשמית המודל מוגדר עבור השפה האנגלית בלבד, ואין תיעוד לגבי טיב הפעולה שלו בעברית.

אותה משפחה

QwQ יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בחלון ההקשר המלא של 131 אלף טוקנים בגרסה הזו?

לא מומלץ לעבור 32,768 טוקנים בקבצי GGUF הנוכחיים. המפתחים מציינים שכדי לעבור את הסף הזה נדרש מנגנון YaRN שנתמך כרגע רק ב־vLLM עבור המודלים שאינם GGUF.

איך מונעים ממנו להיתקע בלולאות אינסופיות?

צריך להגדיר טמפרטורה סביב 0.6 עם TopP של 0.95 ו־TopK בין 20 ל־40. אסור להריץ פיענוח חמדן עם טמפרטורה אפס, ואפשר להעלות מעט את ה־presence penalty אך בזהירות כדי לא לגרור ערבוב שפות.

איך מריצים

ההרצה המקומית מתבצעת בעיקר דרך llama.cpp, כשהוראות ההרצה דורשות להגדיר ידנית את תג הפתיחה של תהליך החשיבה. בשביל להריץ קוונטיזציה נמוכה כמו q4_K_M עם הקשר בסיסי תצטרכו כרטיס מסך חזק עם מספיק זיכרון וידאו, או חלוקה בין המעבד לכרטיס שתאט משמעותית את הקצב. בגרסאות q8_0 הדרישות קופצות ומחייבות חומרה ייעודית כבדה בהרבה.

אם אתם צריכים לפתוח את ההקשר מעבר ל־32,768 טוקנים ועד למקסימום המלא, פורמט GGUF מגביל אתכם, כי תמיכה בהרחבת YaRN קיימת כרגע רק ב־vLLM למודלים הרגילים. במקרים כאלה, או אם אין לכם שרת מקומי חזק, שימוש בשרת מרוחק עדיף בהרבה על פני התעקשות להריץ מקומית.

ollama run hf.co/Qwen/QwQ-32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או מסחרית. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים שתפיצו הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗