GPT
Q

Qwen_Qwen3-30B-A3B-GGUF

קוד פתוח

bartowskiapache-2.02025-04-28

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסאות מכווצות של מודל השפה מבית עליבאבא להרצה מקומית. הוא מאפשר לקבל יכולות יצירת טקסט מתקדמות ישירות על המחשב בלי תלות בענן.

  • 456 GBמשקל הקבצים
  • 17,638הורדות בחודש
  • 60לייקים

מה זה

המאגר מכיל המרות שונות של המודל לפורמט GGUF בעזרת llama.cpp בגרסה b5200, תוך שימוש בכיול imatrix שמצמצם את איבוד הדיוק בדחיסה. הוא מיועד למשימות יצירת טקסט ומגיע עם פורמט הנחיות מובנה הכולל תגיות התחלה וסיום למערכת, למשתמש ולעוזר.

המייחד את המאגר הוא המגוון הרחב של הגרסאות, החל מקובץ BF16 מלא בגודל 61.10 גיגה בייט ועד לקבצי דחיסה אגרסיביים של שתי סיביות בגודל 8.15 גיגה בייט. בחלק מהגרסאות, כמו Q4_K_L, משקלי ה־embeddings והפלט נשמרו באיכות Q8_0 כדי לשפר את התוצאה הסופית ביחס לגודל הקובץ.

מתאים ל

  • עבודה עצמאית ללא אינטרנט

    הרצה ישירה דרך LM Studio או llama.cpp על גבי חומרה מקומית ללא תלות ברשת.

  • הרצה מקומית על כרטיס 24GB

    קובץ Q4_K_M נכנס במלואו לזיכרון כרטיסי 24 גיגה בייט ומספק ביצועים מאוזנים.

  • אירוח מקומי למערכות פנימיות

    רישיון apache-2.0 מתאים להטמעה מלאה בתוך יישומים ארגוניים ללא עלויות רישוי.

איפה זה נופל

הגרסאות המכווצות במיוחד, כמו סדרת Q2 ו־IQ2 שיורדות עד 8.15 גיגה בייט, מוגדרות במפורש כבעלות איכות נמוכה מאוד, והן עלולות לפגוע בלכידות התשובות. שימוש בדחיסות מסוג I-quant על גבי מעבד מחשב יוביל לביצועים איטיים בהשוואה לחלופות K-quant, כך שיש פשרה כואבת בין גודל למהירות.

אותה משפחה

Qwen-Qwen3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

עבור רוב האנשים, קובץ Q4_K_M במשקל 18.63 גיגה בייט נותן את האיזון הנכון בין איכות לגודל. אם זיכרון כרטיס המסך קטן יותר, אפשר לבחור בגרסת IQ4_XS שחוסכת עוד מקום עם פגיעה מינימלית.

האם צריך להוריד את כל 456 הגיגה בייט של המאגר?

ממש לא, מורידים רק קובץ בודד שמתאים לנפח הזיכרון שיש לכם במחשב. הורדת כל המאגר רק תבזבז שטח אחסון וזמן ללא שום צורך טכני.

איך מריצים

טוענים את הקובץ המתאים ישירות לתוך LM Studio או מריצים דרך llama.cpp. גרסת ברירת המחדל המאוזנת לרוב המשתמשים היא Q4_K_M ששוקלת 18.63 גיגה בייט, ודורשת כרטיס מסך עם זיכרון ייעודי של לפחות 20 או 24 גיגה בייט כדי לרוץ במהירות מלאה.

אם אין לכם חומרה חזקה, אפשר לרדת לגרסאות נמוכות כמו IQ3_M בנפח 14.08 גיגה בייט או לפצל את הריצה בין כרטיס המסך לזיכרון הראשי. למי שאין כרטיס מסך חזק בכלל, עדיף להשתמש ב־API מרוחק במקום לנסות להריץ מודל בגודל כזה על מעבד בלבד, תהליך שיהיה איטי להחריד.

ollama run hf.co/bartowski/Qwen_Qwen3-30B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. אין בעיה לשלב אותו במוצר מסחרי כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗