GPT
Q

Qwen3-30B-A3B-128K-GGUF

קוד פתוח

unslothapache-2.02025-04-29

  • transformers
  • gguf
  • qwen3_moe
  • text-generation
  • qwen3

מודל תערובת מומחים של 30 מיליארד פרמטרים שמפעיל רק 3.3 בכל שלב. הוא מאפשר מעבר חופשי בין מצב מחשבה מעמיק למענה ישיר ומהיר.

  • 131,072טוקנים בהקשר
  • 464 GBמשקל הקבצים
  • 2,423הורדות בחודש
  • 60לייקים

מה זה

מדובר בארכיטקטורת MoE עם 128 מומחים בסך הכול, שמתוכם 8 מופעלים בכל טוקן, כך שמקבלים איכות של מודל בינוני בעלות חישוב נמוכה מאוד. הייחוד העיקרי כאן הוא המתג בין מצב חשיבה למצב רגיל. במקום להריץ שני מודלים נפרדים, אחד להסבר לוגי עמוק עם תגיות מחשבה ואחד לצ'אט שוטף, מחליפים ביניהם באותה שיחה באמצעות פקודות פשוטות.

הוא מאומן מראש על פני 48 שכבות ותומך בהרחבת הקשר עד 131,072 טוקנים בשיטת YaRN, לעומת 32,768 טוקנים באופן טבעי. המבנה שלו מיועד להפעלת סוכנים וקריאה לכלים חיצוניים בלי תלות במעטפת חיצונית כבדה.

מתאים ל

  • סוכנים עצמאיים

    הוא מפעיל כלים בדיוק גבוה ומאפשר תכנון לוגי מעמיק לפני ביצוע פעולות.

  • פתרון בעיות קוד ומתמטיקה

    מצב החשיבה המובנה מייצר שלבי ביניים מפורטים שמונעים טעויות חישוב.

  • ניתוח מסמכים ארוכים

    תמיכה בעד 131 אלף טוקנים מאפשרת לעבד קבצים כבדים ברצף אחד.

איפה זה נופל

הפעלת הרחבת ההקשר YaRN בכלים פתוחים עובדת בצורה סטטית, מה שפוגע באיכות המענה בטקסטים קצרים כל עוד ההגדרה דולקת. אסור להשתמש בפיענוח חמדני כי הוא גורם למודל להיתקע בלולאות אינסופיות של חזרות. בנוסף, העלאת מדד ה־presence penalty כדי לפתור חזרות עלולה לגרום לו לערבב שפות בתוך אותה תשובה, והוא דורש ניקוי ידני של בלוק המחשבה מהיסטוריית השיחה כדי לא לנפח את ההקשר סתם.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו?

המודל מכיל מעל 30 מיליארד פרמטרים שחייבים לשבת בזיכרון, גם אם רק חלקם פעילים בכל רגע. כמות הזיכרון המדויקת תלויה ברמת הכימות שתורידו, אך בכל מקרה תצטרכו מספיק נפח לכל המשקלים בתוספת זיכרון לחלון ההקשר.

איך מכבים את בלוק החשיבה כדי לקבל תשובות מהירות?

אפשר להעביר את הפרמטר הייעודי בטמפלייט של הצ'אט כדי לבטל את החשיבה מראש. בשיחה חיה אפשר פשוט לכתוב no_think בפנייה למודל והוא ידלג על שלב הניתוח המקדים.

איך מריצים

המשקל הכולל של הקבצים בפורמט הזה מגיע ל־464 גיגה בייט בגלל פיצול לכמה גרסאות כימות שונות, ולכן לא מורידים את כל התיקייה אלא בוחרים קובץ בודד שמתאים לזיכרון שלכם. להרצה מקומית משתמשים ב־llama.cpp, Ollama או שרתים כמו vLLM ו־SGLang, בתנאי שגרסת transformers שלכם היא 4.51.0 ומעלה כדי לזהות את הארכיטקטורה.

המערכת צריכה להחזיק בזיכרון את כל 30.5 מיליארד הפרמטרים, גם אם בזמן אמת מחושבים רק 3.3 מיליארד. אם אין לכם כרטיסי מסך עם מספיק VRAM להחזיק את הכימות הרצוי יחד עם זיכרון להקשר ארוך, תשלמו פחות על שרת מנוהל או API חיצוני.

ollama run hf.co/unsloth/Qwen3-30B-A3B-128K-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל במוצרים סגורים. אתם נדרשים לשמור על הודעות זכויות היוצרים והרישיון המקורי, בלי חובה לחשוף את קוד המקור של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗