GPT
Q

QwQ-32B-Preview-GGUF

קוד פתוח

bartowskiapache-2.02024-11-27

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסת GGUF מכווצת של מודל ההסקה QwQ מבית Qwen, שמיועדת למפתחים שרוצים יכולות ניתוח עמוקות מקומית על החומרה שלהם.

  • 508 GBמשקל הקבצים
  • 4,022הורדות בחודש
  • 102לייקים

מה זה

המאגר הזה מציע המרות מגוונות בפורמט GGUF למודל QwQ-32B-Preview, שפותח במקור כמודל חשיבה מתקדם על בסיס 32 מיליארד פרמטרים. המטרה כאן היא לייצר שרשראות חשיבה מפורטות לפתרון בעיות סבוכות, בעיקר בקוד ובמתמטיקה, תחומים שבהם מודלים רגילים באותו סדר גודל נוטים לטעות מהר מדי.

bartowski ייצר את כל הגרסאות בעזרת llama.cpp וטכניקת imatrix, ששומרת על דיוק המשקלים גם כשדוחסים אותם משמעותית. הדגש פה הוא על גמישות, החל ממשקלים מלאים בפורמט BF16 ועד כיולים קיצוניים של שני ביט, כך שכל אחד יכול לבחור את האיזון המתאים לו בין צריכת זיכרון לביצועים.

מתאים ל

  • פתרון בעיות קוד סבוכות

    מודל הסקה שבוחן לעומק לוגיקה תכנותית ומאתר באגים מורכבים לפני שהוא פולט את התשובה.

  • ניתוח מתמטי ומדעי

    יכולת פירוק של שאלות חישוביות ארוכות לשלבים מובנים, תוך הפחתת טעויות חישוב.

  • הרצה מקומית בסביבה מאובטחת

    הפעלת מודל שמתאים לתחנות עבודה חזקות ללא תלות ברשת או סכנת דליפת מידע.

איפה זה נופל

מדובר בגרסת תצוגה מקדימה, מה שאומר שהיציבות לא מובטחת והתנהגות המודל עדיין ניסיונית. בנוסף, מודלים שמשתמשים בשרשראות חשיבה ארוכות מייצרים המון טוקנים לפני שהם מחזירים תשובה סופית, תהליך שמעלה את זמן ההמתנה ועלול לחרוג מהר מאוד מחלונות זיכרון מצומצמים.

הכרטיס מציין תמיכה באנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד טקסטים מורכבים בעברית. לפני שמשלבים אותו בזרימת עבודה אמיתית, חובה לוודא שהוא לא נתקע בלולאות חשיבה אינסופיות.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד למחשב עם כרטיס מסך של 24GB?

האפשרות המאוזנת ביותר היא Q4_K_M ששוקלת 19.85GB ונכנסת בשלמותה לתוך הזיכרון של הכרטיס. אם חסר מקום לעיבוד ההקשר, אפשר לרדת לגרסת IQ4_XS ששוקלת 17.69GB ומציעה ביצועים דומים מאוד.

האם המודל מתאים לשיחה שוטפת וקצרה מול משתמשים?

לא במיוחד. בגלל שמדובר במודל הסקה, הוא מקדיש זמן ומשאבים ליצירת שרשרת חשיבה לפני המענה, מה שגורם להשהיה ארוכה יחסית שלא מתאימה לבוטים מהירים.

מה ההבדל בין גרסאות K-quants לבין I-quants?

גרסאות I-quants משתמשות באלגוריתם חדש ששומר על איכות טובה יותר במשקלים נמוכים של מתחת ל־4 ביט, במיוחד למי שמריץ על כרטיסי Nvidia דרך cuBLAS. אם אתם עובדים עם 4 או 5 ביט, אפשר להישאר עם ה־K-quants הרגילים בלי לחשוב פעמיים.

איך מריצים

המשקל המלא שוקל 65.54GB, אבל רוב האנשים יכוונו לגרסאות 4 ביט כמו Q4_K_M שדורשות 19.85GB. כדי לקבל קצב סביר, צריך כרטיס מסך עם לפחות 24GB של VRAM, או לחלופין שילוב של זיכרון מערכת וכרטיס מסך דרך LM Studio או llama.cpp, מה שיאט את התוצאה משמעותית.

יש פה גם גרסאות ייעודיות למעבדי ARM ושרתים תומכי AVX2 כמו Q4_0_8_8, שמאיצות עיבוד בלי שימוש במאיץ גרפי אך אינן מתאימות למחשבי מק. אם יש לכם מחשב נייד פשוט בלי כרטיס חזק, הרצה מקומית של 32B תהיה איטית ומייאשת, ובמצב כזה עדיף לצרוך את המודל דרך ספק ענן חיצוני.

ollama run hf.co/bartowski/QwQ-32B-Preview-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. המשמעות עבורכם היא שניתן להטמיע את המשקלים במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗