GPT
Q

unsloth/Qwen3-30B-A3B-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3_moe
  • text-generation
  • qwen3

זהו מודל תערובת מומחים שמפעיל רק 3.3 מיליארד פרמטרים בכל שלב מתוך 30.5 מיליארד בסך הכול. הוא מאפשר לעבור בין מצב חשיבה עמוק לתשובות מהירות באותה שיחה.

  • 40,960טוקנים בהקשר
  • 464 GBמשקל הקבצים
  • 52,178הורדות בחודש
  • 287לייקים

מה זה

מדובר בארכיטקטורת MoE הכוללת 128 מומחים, שמתוכם המערכת מפעילה רק 8 עבור כל טוקן. המבנה הזה נותן רוחב יריעה וידע של מודל גדול, אבל שומר על מהירות חישוב שדומה למודלים קטנים בהרבה. הוא מיועד ליצירת טקסט, כתיבת קוד, פתרון בעיות מתמטיות והפעלת כלים חיצוניים כסוכן אוטונומי.

הייחוד המרכזי כאן הוא היכולת לדלג בין מצבי עבודה בלי להחליף משקלים. אתם יכולים להפעיל מצב חשיבה מעמיק שמייצר שרשרת מחשבה מפורטת בתוך תגיות ייעודיות לפתרון לוגיקה מסובכת, או לכבות אותו ולקבל מענה קצר וישיר לשיחות רגילות. המעבר מתבצע ברמת הפרומפט בעזרת פקודות פשוטות, מה שחוסך תחזוקה של שני מודלים שונים במקביל.

חלון ההקשר הבסיסי עומד על 32,768 טוקנים, כאשר הקובץ מוגדר עד 40,960 טוקנים כדי להשאיר מקום לפלט ארוך, ואפשר להרחיב אותו עד 131,072 באמצעות שיטת YaRN. הדבר הופך אותו לפתרון רלוונטי למי שצריך לעבד תיעוד טכני נרחב או קוד ארוך בלי לאבד את תחילת השיחה.

מתאים ל

  • סוכנים מבוססי כלים

    שילוב עם ספריות כלים ו־MCP בזכות יכולת מובנית לפעול מול ממשקים חיצוניים בשני מצבי העבודה.

  • פתרון בעיות קוד מורכבות

    שימוש במצב החשיבה המובנה לייצור פתרונות אלגוריתמיים שדורשים תכנון מקדים של כמה שלבים.

  • עוזר שיחה מהיר וחסכוני

    כיבוי מצב החשיבה לצורך מענה מיידי בעלות חישוב נמוכה, בזכות הפעלה של 3.3 מיליארד פרמטרים בלבד.

איפה זה נופל

אסור להשתמש בפיענוח חמדן במצב חשיבה, אחרת המודל נכנס ללולאות אינסופיות של חזרות ומאבד את ההיגיון. בנוסף, הרחבת ההקשר מעבר לבסיס באמצעות YaRN סטטי עלולה לפגוע בדיוק של המודל בטקסטים קצרים. החיסרון המשמעותי ביותר לישראלים הוא היעדר תמיכה רשמית בעברית בתיעוד, שכן המודל מוגדר עבור השפה האנגלית בלבד, ולכן יש לבדוק היטב את איכות הפלט לפני שמשלבים אותו במוצר שמיועד לשוק המקומי.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך עוברים בין מצב תשובה רגיל למצב חשיבה מעמיק?

אפשר להוסיף את התגיות no_think או think בתוך הפרומפט של המשתמש, או לקבוע את הדגל המתאים בהגדרות הטוקנייזר. במצב מופעל המודל כותב את שלבי המחשבה בתוך בלוק ייעודי לפני הפלט הסופי, ובמצב כבוי הוא עונה מיד כמו מודל שיחה רגיל.

האם צריך להוריד את כל 464 הגיגה־בייט שמופיעים בעמוד?

ממש לא. המאגר מכיל עשרות קבצים שמייצגים רמות כיול ודיוק שונות של הפורמט. אתם בוחרים ומורידים רק קובץ בודד שמתאים לגודל הזיכרון שיש לכם בכרטיס המסך או במחשב.

איך מריצים

המשקל הכולל של הקבצים במאגר הזה מגיע ל־464 גיגה־בייט ב־33 קבצים שונים, שכן מדובר בגרסאות כיול שונות בפורמט GGUF ובדיוק מקורי. להרצה מקומית ב־llama.cpp או Ollama תצטרכו להוריד רק את הקובץ המתאים לזיכרון שלכם, ולא את כל המאגר. להרצה בשרת עם vLLM או SGLang דרושה גרסת transformers עדכנית מ־4.51.0 ומעלה כדי שהמערכת תזהה את הארכיטקטורה.

מבחינת חומרה, למרות שרק 3.3 מיליארד פרמטרים פעילים בזמן אמת, כל 30.5 מיליארד הפרמטרים חייבים לשבת בזיכרון ה־RAM או ה־VRAM. אם אין לכם לפחות 24 עד 32 גיגה־בייט זיכרון פנוי עבור גרסאות מכוילות היטב, עדיף לפנות ל־API חיצוני ולא להילחם עם החומרה המקומית.

ollama run hf.co/unsloth/Qwen3-30B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בכל עותק או נגזרת של המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗