GPT
Q

byteshape/Qwen3-Coder-30B-A3B-Instruct-GGUF

קוד פתוח

byteshapeapache-2.02026-02-17

  • transformers
  • gguf
  • qwen
  • qwen3
  • qwen3-coder

גרסת קוונטיזציה של מודל קוד בגודל 30B, שפותחה כדי להידחס עד 2.65 ביטים בלי לאבד יכולת. היא מיועדת למי שרוצה ביצועי קוד גבוהים מקומית על חומרה מוגבלת.

  • 138 GBמשקל הקבצים
  • 2,583הורדות בחודש
  • 41לייקים

מה זה

מדובר בהמרה לפורמט GGUF של מודל ההוראות לכתיבת קוד Qwen3-Coder-30B-A3B. צוות byteshape השתמש בשיטה שנקראת ShapeLearn, שבוחרת ייצוג מספרי ייעודי לכל טנסור בנפרד כדי להקטין את הנפח הכללי.

המודל מיועד לכתיבת קוד, פתרון בעיות מתמטיות והפעלת פונקציות. המפתחים בחנו אותו מול מבחנים כמו LiveCodeBench, HumanEval ו־BFCL-V3, במטרה לשמור על פלט שמיש גם בדחיסה אגרסיבית במיוחד.

החידוש המרכזי פה הוא הפיצול המכוון בין חומרות. יש קבצים שנבנו במיוחד למהירות עיבוד על מעבדים מרכזיים, ואחרים שמותאמים לארכיטקטורה של מעבדים גרפיים, במקום להשתמש באותה קוונטיזציה לכל סוגי החומרה.

מתאים ל

  • השלמת קוד מקומית

    משקלי ה־IQ הקטנים נכנסים בכרטיסי מסך ביתיים ומאפשרים עבודה בלי שליחת קוד החוצה.

  • הפעלת פונקציות ואוטומציה

    המודל נמדד על מבחן BFCL-V3 ומסוגל לקבל החלטות ולהריץ כלים לפי הוראות מוגדרות.

  • פיתוח על מחשב ללא GPU

    גרסאות ה־KQ מותאמות למעבדי אינטל רגילים ומאפשרות קבלת סיוע בקוד על חומרה משרדית.

איפה זה נופל

במשקלים הנמוכים של 2.65 עד 2.90 ביטים יש ירידה מסוימת בדיוק, במיוחד במשימות מורכבות של קוד ולוגיקה. שמות הקבצים יכולים להטעות, כיוון שהתוויות כמו IQ4_XS משמשות רק לתצוגה ואינן זהות לקוונטיזציות הרגילות של llama.cpp. בנוסף, חבילת הקבצים המלאה דורשת הורדה גדולה אם לא בוחרים קובץ בודד במדויק מראש.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך כל הרשימה?

הבחירה תלויה בחומרה שלכם. אם אתם מריצים על כרטיס מסך בחרו קובץ עם קידומת IQ, ואם אתם מריצים על מעבד רגיל קחו קובץ עם קידומת KQ, כשדגמי 4.20bpw יתנו את התוצאה המדויקת ביותר ומודלי ה־2.65bpw יתפסו הכי פחות זיכרון.

האם אפשר להשתמש במודל הזה ישירות דרך Ollama?

כן, המודל תומך ב־Ollama מהקופסה. מריצים את פקודת ollama run עם כתובת המאגר ושם קובץ ה־GGUF הספציפי שתרצו לטעון.

איך מריצים

ההרצה נעשית דרך llama.cpp או ישירות באמצעות פקודת ollama run עם הנתיב לקובץ הספציפי. הקבצים מחולקים לשתי משפחות: גרסאות KQ שמותאמות לריצה על מעבד רגיל, וגרסאות IQ שמשלבות שיטות קוונטיזציה שמיועדות לכרטיסי מסך.

בגרסאות המכווצות ביותר המודל שוקל סביב 10.1 גיגהבייט, ודגם ה־4.20 ביטים מגיע ל־16 גיגהבייט. אם אתם מכוונים להרצה על כרטיס מסך, תצטרכו זיכרון וידאו שמכיל את הקובץ במלואו, בעוד שמשתמשי מעבד יכולים להסתפק בזיכרון RAM סטנדרטי אבל יסבלו מקצב יצירת טוקנים נמוך בהרבה.

ollama run hf.co/byteshape/Qwen3-Coder-30B-A3B-Instruct-GGUF:IQ3_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים פנימיים ולשלב אותו במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗