GPT
Q

byteshape/Qwen3-4B-Instruct-2507-GGUF

קוד פתוח

byteshapeapache-2.02025-12-09

  • transformers
  • gguf
  • qwen
  • qwen3
  • byteshape

גרסאות מכווצות במיוחד של מודל הוראות בגודל 4 מיליארד פרמטרים. המטרה כאן היא לסחוט איכות מקסימלית ממשקלים זעירים של פחות מגיגה וחצי עד שניים וחצי גיגה.

  • 28.8 GBמשקל הקבצים
  • 2,385הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל שפת הוראות שעבר כימות באמצעות שיטה בשם ShapeLearn, שמתאימה את סוג הנתונים לכל טנזור בנפרד כדי לצמצם את הפגיעה באיכות כשדוחסים מתחת לארבעה ביטים. החבילה מציעה חלוקה ברורה לשני מסלולים: קובצי KQ שמיועדים לעבודה מהירה על מעבדי אינטל רגילים, וקובצי IQ שמנצלים את החומרה של כרטיסי מסך מודרניים של אנבידיה.

הבדיקות של המפתחים מציגות פערים עצומים ביחס לכיווץ. בגרסאות הנמוכות סביב 2.55 ביט, האיכות המנורמלת צונחת לאזור 70%, מה שאומר ירידה מורגשת מאוד בהבנת הוראות מורכבות. לעומת זאת, כשמטפסים לאזור 4 ביט ומעלה, המודל שומר על כמעט 99% מהיכולת המקורית שלו בנפח של בערך 2 גיגהבייט בלבד.

מתאים ל

  • עוזר מקומי על לפטופ ישן

    שוקל פחות משני גיגהבייט ומספק מענה סביר לפקודות פשוטות בלי להעמיס על המעבד או הזיכרון.

  • בוט קצה במכשירי IoT

    מתאים לשרתים זעירים בזכות גרסאות ה־KQ שמותאמות לריצה על מעבדים חלשים ללא מאיץ גרפי.

  • סינון ומיון טקסט מקומי

    גרסאות ה־4 ביט מגיעות לביצועים כמעט מלאים בנפח זעיר שמתאים למיון מהיר בלי עלויות ענן.

איפה זה נופל

במשקלים הנמוכים ביותר, סביב 2.55 עד 2.77 ביט, המודל מאבד בערך 30% מהביצועים שלו לפי המדד המנורמל של היוצרים. ברמות האלה הוא נוטה לאבד עקביות, לשגות במבנה הפלט ולהתקשות במעקב אחר הנחיות שלילה. בנוסף, תוויות השמות של הקבצים כמו IQ4_XS מטעות ולא תואמות לפרופילים הרגילים של llama.cpp, מה שמחייב לבדוק את מספר הביטים המדויק לפני הבחירה.

שאלות
נפוצות

איזה קובץ בדיוק כדאי לי להוריד מהרשימה?

אם אתם על מעבד רגיל, קחו את KQ-7 או KQ-8 ששומרים על מעל 95% איכות במשקל של פחות מ־2.2 גיגה. אם יש לכם כרטיס מסך של אנבידיה, IQ-6 או IQ-7 יתנו מהירות גבוהה יותר באותה רמת דיוק.

למה יש גרסאות שונות עם אותו שם בדיוק?

היוצרים השתמשו בשמות האלה רק כדי שהמערכת של Hugging Face תציג את הטבלה בצורה מסודרת. הכימות בפועל מותאם אישית לפי שיטת ShapeLearn שלהם, ולכן צריך לבחור לפי ה־bpw, שהוא מספר הביטים בפועל למשקל, ולא לפי התווית.

איך מריצים

טוענים את הקבצים ישירות לתוך llama.cpp או מריצים פקודה אחת פשוטה בתוך Ollama שמורידה את הקובץ הספציפי מהמאגר. אם מריצים על מעבד רגיל, לוקחים קובץ עם סיומת KQ. אם יש כרטיס מסך מודרני, בוחרים בקובץ מסדרת IQ לקבלת קצב ייצור מילים גבוה יותר.

מבחינת חומרה, קבצים של 1.3 עד 2.4 גיגהבייט ירוצו בקלות על כל מחשב נייד מודרני או שרת ענן פשוט, ואפילו על רספברי פאי לפי נתוני הפרויקט. אם אתם צריכים לנתח מסמכים ארוכים או לבצע משימות היגיון סבוכות מאוד, אין סיבה להתעקש על הרצה מקומית של 4 מיליארד פרמטרים, ועדיף לשלוח קריאה לשרת חיצוני עם מודל ענק.

ollama run hf.co/byteshape/Qwen3-4B-Instruct-2507-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים בלי לשלם תמלוגים, בתנאי ששומרים על הצהרת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗