GPT
Q

Qwen3-30B-A3B-Instruct-2507-GGUF

קוד פתוח

unslothapache-2.02025-07-29

  • transformers
  • gguf
  • qwen
  • qwen3
  • unsloth

גרסת מומחים קלה שדורשת זיכרון של מודל ענק אבל רצה במהירות של מודל קטן. היא עונה ישירות בלי לחשוב שעות בכל פרומפט.

  • 472 GBמשקל הקבצים
  • 486,250הורדות בחודש
  • 317לייקים

מה זה

מדובר בארכיטקטורת מומחים עם 30.5 מיליארד פרמטרים בסך הכול, אבל בפועל רק 3.3 מיליארד מתוכם פעילים בכל שלב יצירה. זה אומר שמקבלים איכות תשובות וידע רחב של מודל בגודל בינוני, לצד מהירות תגובה גבוהה מאוד כי המעבד או הכרטיס הגרפי מחשבים חלק זעיר מהמשקלים בו זמנית. הדגם הזה מכוון לעבודה מהירה וישירה לפי הוראות, והוא לא מייצר בלוקים של מחשבה לפני התשובה.

במבחני ביצועים הוא מזנק בעיקר במשימות כתיבה ויצירה, שבהן הוא מוביל על מודלים גדולים בהרבה עם 86 נקודות בבנצ׳מרק הכתיבה, וגם בהיגיון צרוף הוא מגיע ל־90 נקודות ב־ZebraLogic. במתמטיקה מתקדמת ותכנות מורכב הוא מציג שיפור ניכר מגרסאות קודמות, אם כי הוא לא מנצח מודלי דגל בכל פרמטר.

מתאים ל

  • מענה מהיר בפניות לקוחות

    רק 3.3 מיליארד פרמטרים פעילים, מה שנותן זמני תגובה קצרים בלי שרשראות מחשבה ארוכות.

  • עיבוד מסמכים כבדים

    תמיכה מובנית בחלון הקשר של 262 אלף טוקנים מאפשרת לקרוא קבצים ענקיים ברצף.

  • כתיבת תוכן ויצירה

    המודל קיבל ציונים גבוהים במיוחד בבנצ'מרקים של כתיבה יצירתית בהשוואה למתחרים.

איפה זה נופל

המודל חלש משמעותית בסוכנים מורכבים ורב־שלביים. במבחני שימוש בכלים בתחום הטלקום הוא השיג רק 12.3 נקודות, תוצאה נמוכה בהרבה ממתחריו, ובמשימות סוכן נוספות הוא מפגר מאחור. בנוסף, אם תעלו את מקדם מניעת החזרתיות בהגדרות כדי לעצור לולאות טקסט, הכרטיס מזהיר מראש מפגיעה בביצועים ומערבוב שפות.

שאלות
נפוצות

כמה זיכרון וידאו אני באמת צריך כדי להריץ אותו?

מכיוון שכל 30.5 מיליארד הפרמטרים חייבים להיטען לזיכרון, תצטרכו לפחות 24 עד 32 גיגה זיכרון עבור גרסאות מכווצות היטב. אם תרצו לנצל הקשר ארוך של מעבר לכמה עשרות אלפי טוקנים, תזדקקו לזיכרון נוסף משמעותי.

האם המודל תומך בחשיבה איטית ומפורטת?

לא, הדגם הזה מוגדר מראש לעבודה ללא בלוקים של מחשבה. הוא עונה מיד על ההוראות שלכם בלי לייצר תגיות חשיבה מקדימות.

איך ביצועי הקוד והמתמטיקה שלו?

הוא מציג תוצאות מפתיעות למודל בגודלו במתמטיקה תחרותית עם ציון 61.3 ב־AIME25, וביצועי קידוד יציבים, אך הוא אינו מחליף מודלים ייעודיים גדולים יותר.

איך מריצים

למרות שרק מעט פרמטרים פעילים, כל 30 המיליארד חייבים לשבת בתוך הזיכרון. קבצי ה־GGUF המכווצים כאן מאפשרים להריץ אותו דרך ספריות כמו llama.cpp או Ollama, אבל תצטרכו מספיק זיכרון וידאו או זיכרון אחוד כדי להחזיק משקל של עשרות גיגה־בייט בהתאם לקוונטיזציה שתורידו. פריסה בשרת אפשרית בקלות דרך vLLM או SGLang.

אם יש לכם מחשב מקומי עם פחות מ־32 גיגה זיכרון פנוי, אין טעם לנסות להריץ אותו אצלכם. במצב כזה, או במקרים שבהם תרצו לנצל את חלון ההקשר העצום שלו שמגיע עד 262,144 טוקנים ויגמור לכם את הראם מיד, עדיף בהרבה לפנות ל־API חיצוני שמארח אותו.

ollama run hf.co/unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

33 קבצים במאגר, 472 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗