GPT
Q

Qwen_Qwen3-32B-GGUF

קוד פתוח

bartowskiapache-2.02025-04-28

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קוונטיזציה בפורמט GGUF למודל של עליבאבא עם 32 מיליארד פרמטרים. היא מאפשרת להריץ מודל חזק מקומית בלי לקנות שרת ייעודי.

  • 496 GBמשקל הקבצים
  • 12,428הורדות בחודש
  • 41לייקים

מה זה

המאגר הזה מציג המרות קוונטיזציה של Qwen3-32B באמצעות llama.cpp, תוך שימוש במערך כיול imatrix שנועד לצמצם פגיעה באיכות התוכן. המודל מייצר טקסט על בסיס פרומפט במבנה שיחה סטנדרטי של צ'אט, ומציע חלופה מעשית למי שרוצה ביצועים של מודל גדול יחסית על מחשב מקומי או שרת צנוע.

הממיר bartowski הוסיף כאן גרסאות ששומרות על משקולות הפלט וההטמעה בדיוק גבוה יותר של שמונה ביט, למשל בגרסאות כמו Q4_K_L או Q6_K_L, כדי לשפר את הדיוק בלי לנפח את כל הקובץ. במקום להוריד מודל של עשרות ג'יגה בייט בבת אחת, מקבלים פה טווח רחב שנע מקבצים זעירים ועד קבצים כבדים שקרובים למקור.

מתאים ל

  • עוזר פיתוח מקומי

    הרצה מקומית מוחלטת של מודל 32B בתוך LM Studio לשמירה על פרטיות קוד רגיש.

  • הסקה על כרטיס 24GB

    שימוש בגרסת Q4_K_M שמשאירה מספיק מקום לזיכרון עבודה בכרטיסי מסך סטנדרטיים.

  • עיבוד טקסט במכונות ARM

    ניצול גרסאות Q4_0 ו־IQ4_NL שתומכות בסידור משקולות דינמי לשיפור מהירות במעבדים תואמים.

איפה זה נופל

הכרטיס לא מציג מבחני ביצועים או השוואות דיוק למודל 32B עצמו, אלא רק נתוני מהירות ישנים מריצה על מעבד של מודל קטן בהרבה. בנוסף, הקוונטים הנמוכים ביותר ברמת 2 ביט מוגדרים במפורש כבעלי איכות נמוכה מאוד, כך שלא כדאי לבנות עליהם למשימות שמחייבות היגיון עקבי. לפני שילוב בקוד שלכם, תצטרכו לוודא עצמאית איך המודל מתמודד עם השפה והמשימות הספציפיות שחשובות לכם.

אותה משפחה

Qwen-Qwen3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד אם יש לי כרטיס מסך של 24GB?

האפשרות המאוזנת ביותר היא Q4_K_M ששוקלת 19.76GB ונכנסת בזיכרון של כרטיס כזה. אם רוצים איכות מעט טובה יותר אפשר לנסות את Q4_K_L, ואם הזיכרון נחנק עוברים ל־IQ4_XS.

האם צריך להוריד את כל עשרות הקבצים שבעמוד?

ממש לא, צריך לבחור רק קובץ GGUF יחיד לפי מגבלות החומרה שלכם. מורידים אותו ישירות דרך כלי ההרצה או באמצעות huggingface-cli עם ציון שם הקובץ הרצוי.

מה המשמעות של גרסאות עם סיומת L כמו Q5_K_L?

בגרסאות האלה שכבות ההטמעה ומשקולות הפלט נשמרות בדיוק של שמונה ביט במקום רמת הדחיסה הכללית. זה מעלה מעט את גודל הקובץ אבל מונע שגיאות בדיוק התשובות.

איך מריצים

טוענים את הקובץ המתאים ישירות לתוך LM Studio או llama.cpp מגרסה b5200 ומעלה. כדי להריץ הכל בזיכרון של כרטיס המסך צריך כרטיס עם מספיק VRAM, לפחות גיגה או שניים מעל נפח הקובץ שנבחר, אחרת המערכת תפלוט חלקים לזיכרון הראשי ותאט משמעותית.

גרסת ברירת המחדל לרוב השימושים היא Q4_K_M ששוקלת 19.76 גיגה בייט, ודורשת כרטיס עם 24GB כדי לרוץ חלק. אם יש לכם פחות זיכרון, עדיף לבחור בגרסאות IQ3 או IQ2 שמשתמשות בשיטות דחיסה חדשות, אבל אם אין לכם חומרה חזקה בכלל, שווה לשקול פנייה לשרת חיצוני במקום להעמיס על המעבד.

ollama run hf.co/bartowski/Qwen_Qwen3-32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצר, בלי לחשוף את הקוד שלכם, ובלבד שתשמרו על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗