GPT
Q

byteshape/Qwen3-30B-A3B-Instruct-2507-GGUF

קוד פתוח

byteshapeapache-2.02026-01-05

  • transformers
  • gguf
  • qwen
  • qwen3
  • byteshape

גרסת כימות מיוחדת למודל של 30 מיליארד פרמטרים, שמנסה לשמור על דיוק גבוה גם כשדוחסים אותו לזיכרון של כרטיס מסך בודד או מריצים על מעבד רגיל.

  • 180 GBמשקל הקבצים
  • 1,829הורדות בחודש
  • 84לייקים

מה זה

הפרויקט הזה לוקח את המודל ומכמת אותו בשיטה של ByteShape בשם ShapeLearn. במקום לקבוע רמת דיוק אחידה לכל המשקלים, השיטה בוחרת סוג נתונים שונה לכל טנסור כדי לחסוך מקום בלי לרסק את היכולות. התוצאה היא חלוקה ברורה לשני מסלולים: קבצים עם קידומת KQ שמיועדים להרצה על מעבדי אינטל, וקבצים עם קידומת IQ שמשלבים שיטות כימות כדי למקסם מהירות על כרטיסי מסך.

מבחני הביצועים מציגים ציון איכות מנורמל ביחס לגודל הקובץ. הגרסאות הקטנות ביותר יורדות לאזור 2.66 ביט למשקל ומחזיקות מעמד על 92.8% עד 94.2% מהאיכות המקורית בנפח של קצת מעל עשרה גיגה בייט. אם עולים לאזור 4.67 ביט בנפח של 17.8 גיגה בייט, המדידה מראה שחזור של 99.75% מהציון, מה שאומר שאפשר לקבל כמעט את מלוא היכולת של מודל 30B בפחות מ־18 גיגה בייט של זיכרון.

מתאים ל

  • עבודה מקומית ללא ענן

    מאפשר להריץ מודל הוראות גדול ישירות דרך Ollama בלי להוציא מידע רגיש החוצה.

  • שרתים עם חומרה מוגבלת

    גרסאות ה־KQ מאפשרות לשרת בקשות על מעבדים רגילים כשיש מספיק זיכרון עבודה אך אין כרטיס מסך ייעודי.

  • פריסה בכרטיסי מסך בודדים

    דחיסת המשקלים ל־10 עד 14 גיגה מאפשרת להחזיק מודל 30B שלם על כרטיס גרפי יחיד של 16GB.

איפה זה נופל

השמות של הקבצים עלולים להטעות. היוצרים מציינים במפורש שתוויות כמו IQ4_XS לא תואמות לפרופילי הכימות המקובלים ב־llama.cpp אלא רק נבחרו כדי שהקבצים יופיעו בממשק, כך שאי אפשר להסתמך על התנהגות מוכרת מגרסאות סטנדרטיות. מעבר לזה, הכרטיס מציג רק ציוני איכות מנורמלים ואין בו שום מידע על מבחני ביצועים אמיתיים במשימות כמו קוד, היגיון או שפות אחרות, כך שחובה לבדוק אותו בפועל מול הדאטה שלכם לפני שמסתמכים עליו.

שאלות
נפוצות

מה ההבדל בין גרסאות KQ לגרסאות IQ?

קבצי KQ עברו אופטימיזציה שמכוונת לעבודה מול מעבדים מרכזיים, בעיקר אינטל. קבצי IQ משלבים כמה שיטות כימות שונות כדי להגיע למהירות הפקה מקסימלית על גבי כרטיסי מסך.

באיזה קובץ כדאי לבחור להתחלה?

אם אתם מריצים על כרטיס מסך, גרסת IQ-5 בנפח 13.9 גיגה בייט נותנת מעל 97% מהאיכות ומשאירה מקום בזיכרון. אם המטרה היא הרצה על מעבד, גרסת KQ-6 שוקלת כמעט אותו דבר ומציגה מעל 98% איכות.

איך מריצים

ההרצה מתבצעת ישירות דרך llama.cpp או באמצעות פקודת ollama run שמפנה ישירות לקובץ ה־GGUF הרצוי מתוך המאגר. אין פה צורך בהמרה מוקדמת, פשוט מורידים את הקובץ הספציפי שמתאים לחומרה שלכם.

כרטיס מסך מודרני עם 16 או 24 גיגה בייט של זיכרון יחזיק את רוב גרסאות ה־IQ, כאשר גרסת 3.63 ביט תופסת פחות מ־14 גיגה בייט ונכנסת בקלות בכרטיסים נפוצים. אם אין לכם מעבד גרפי חזק, גרסאות ה־KQ מותאמות לעבודה על זיכרון RAM רגיל של מחשב, אבל אם המחשב שלכם מוגבל במשאבים והמשימה דורשת תגובה מיידית, עדיף לפנות למודל מרוחק דרך ספק ענן במקום להמתין לעיבוד מקומי ארוך.

ollama run hf.co/byteshape/Qwen3-30B-A3B-Instruct-2507-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שהוא רישיון קוד פתוח מתירני מאוד. מותר להשתמש בו לצרכים מסחריים, לשנות את הקבצים, להטמיע אותם בתוך מוצר סגור ולהפיץ אותו ללקוחות, כל עוד שומרים על הודעת זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗