GPT
Q

Qwen_QwQ-32B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-03-05

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסת קוונטיזציה של מודל ההסקה QwQ בגודל 32 מיליארד פרמטרים. מיועדת למי שרוצה להריץ מודל חשיבה כבד מקומית דרך llama.cpp בלי להחזיק שרת יקר.

  • 434 GBמשקל הקבצים
  • 2,484הורדות בחודש
  • 167לייקים

מה זה

המאגר הזה מכיל המרות שונות בפורמט GGUF למודל QwQ-32B של Qwen, שנוצרו באמצעות llama.cpp גרסה b4792 עם imatrix לשיפור הדיוק. המודל מתמקד ביצירת טקסט תוך שימוש בתגית ייעודית של חשיבה לפני הפלט הסופי. הוא שונה ממודלים רגילים בגודל שלו בכך שהוא משקיע טוקנים בתהליך המחשבה עצמו במקום לפלוט תשובה ישירה.

הקובץ כולל שורה ארוכה של שקילות, החל מגרסאות כבדות כמו Q8_0 שתופסת 34.82GB ועד כיווצים אגרסיביים בפורמטים מודרניים כמו IQ2_XXS ששוקל 9.03GB בלבד. היוצר שילב גם גרסאות ביניים שמשמרות את משקולות ה־embeddings והפלט באיכות Q8_0 כדי למזער ירידה ביכולות ההסקה.

בדיקות ביצועים מראות הבדל משמעותי בהתאם לארכיטקטורת החומרה. מעבדי AVX2 ומעבדי ARM מציגים קצבי עיבוד פרומפט שונים בין הפורמטים הישנים והחדשים, כאשר קבצים כמו Q4_0 מנצלים כיום אריזה מחדש של משקולות בזמן ריצה כדי לייעל את המהירות.

מתאים ל

  • פתרון בעיות תכנות מורכבות

    מבנה החשיבה מאפשר לו לתכנן שלבים ולבדוק קוד לעומק לפני פליטת הפתרון הסופי.

  • הסקה לוגית וניתוח טקסט

    מתאים לעיבוד שאלות רב שלביות שדורשות הצלבת נתונים ודיוק בשרשרת המסקנות.

  • הרצה מקומית על חומרה מוגבלת

    גרסאות ה־IQ מאפשרות לבחון מודל של 32 מיליארד פרמטרים גם במחשבים עם מעט זיכרון.

איפה זה נופל

הגרסאות המכווצות ביותר, במיוחד מתחת לרמת 3 ביט כמו IQ2 או Q2, מוגדרות במפורש כבעלות איכות נמוכה מאוד, מה שעלול לשבור את שרשרת ההסקה הלוגית של מודל מהסוג הזה. בנוסף, חבילות ה־IQ איטיות יותר על מעבדי CPU ועל תשתיות Apple Metal בהשוואה לגרסאות K רגילות, והן אינן עובדות עם מנהלי התקנים של Vulkan. חובה לבדוק היטב את תקינות הפורמט של תגיות המערכת והחשיבה, אחרת המודל עלול לדלג על שלב הניתוח.

שאלות
נפוצות

איזה קובץ כדאי להוריד אם יש לי כרטיס של 24GB?

הבחירה המתאימה היא Q4_K_M ששוקל 19.85GB, או גרסת Q4_K_L ששוקלת 20.43GB. שניהם משאירים מספיק זיכרון להקשר ומספקים איזון טוב בין איכות המודל למהירות הפעולה.

האם גרסאות ה־IQ מתאימות לכל מערכת?

לא. גרסאות אלה רצות היטב על כרטיסי Nvidia תחת cuBLAS או AMD תחת rocBLAS, אך אינן נתמכות ב־Vulkan. במעבדי אפל ובמעבדי CPU רגילים הן יעבדו, אך יהיו איטיות יותר מגרסאות K מקבילות.

איך מריצים

בשביל להריץ אותו בקצב סביר, צריך כרטיס מסך שיכול להחזיק את כל הקובץ בזיכרון, פלוס מרווח של גיגהבייט או שניים עבור הקשר. קובץ ה־Q4_K_M המומלץ לרוב השימושים שוקל 19.85GB, מה שאומר שכרטיס של 24GB VRAM הוא המינימום הנדרש לעבודה מלאה על המאיץ הגרפי. אם הזיכרון הגרפי מוגבל, אפשר לחלק את הטעינה בין ה־GPU ל־RAM במחיר של ירידה מורגשת בקצב יצירת הטוקנים.

את הקבצים מריצים ישירות עם llama.cpp או דרך תוכנות כמו LM Studio. במעבדי Nvidia ו־AMD תחת rocBLAS אפשר לבחור בגרסאות ה־IQ הקטנות מתחת ל־4 ביט, אבל משתמשי Vulkan יגלו שהן לא נתמכות. מי שאין לו כרטיס עם 24GB פנויים ועובד על פרויקט שדורש זמן תגובה מהיר, יעדיף לצרוך את המודל דרך שירות ענן חיצוני.

ollama run hf.co/bartowski/Qwen_QwQ-32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של bartowski. במצב כזה אין אישור מפורש לשימוש מסחרי או הפצה בתוך מוצר, ואי אפשר להסתמך עליו מבחינה משפטית. מי שמתכנן להשתמש במודל בסביבה ארגונית חייב לבדוק את תנאי הרישיון המקוריים שפרסמה Qwen בעמוד המקור לפני ההטמעה.

הרישיון המלא בעמוד המודל ↗