GPT
Q

Qwen3-30B-A3B-GGUF

קוד פתוח

Qwenapache-2.02025-05-05

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

ארכיטקטורת מומחים שמפעילה רק 3.3 מיליארד פרמטרים מתוך 30.5 מיליארד בזמן אמת. מקבלים יכולות היגיון וכתיבת קוד של מודל ענק, בלי לשלם בזמן תגובה כבד על כל טוקן.

  • 111 GBמשקל הקבצים
  • 402,570הורדות בחודש
  • 79לייקים

מה זה

מדובר במודל MoE עם 128 מומחים בסך הכול, שמנתב כל טוקן לשמונה מתוכם בלבד. המבנה הזה נותן לו לשמור על משקל זיכרון של מודל 30B, אבל לחשב בפועל במהירות שקרובה למודלים קטנים בהרבה. החידוש הבולט הוא תמיכה מובנית במעבר בין מצב מחשבה מעמיק למצב שיחה מהיר באותו מודל, פשוט באמצעות התגיות think ו־no_think בפרומפט.

הוא מגיע עם חלון הקשר טבעי של 32,768 טוקנים, ונמתח עד 131,072 באמצעות YaRN. המפתחים מציינים שהוא עוקף את דגמי QwQ ו־Qwen2.5 הקודמים במתמטיקה, בקוד ובמשימות סוכן עם כלים חיצוניים, לצד תמיכה ביותר ממאה שפות כולל תרגום ומעקב אחרי הוראות.

מתאים ל

  • סוכני קוד ואוטומציה

    מצב החשיבה נותן פתרון מדויק למשימות תכנות מורכבות, עם אינטגרציה טובה לכלים חיצוניים.

  • בוטים של תמיכה ושיחה

    כיבוי מצב החשיבה מאפשר מענה מהיר וחסכוני, תוך הפעלת 3.3 מיליארד פרמטרים בלבד בכל פלט.

  • ניתוח מסמכים ארוכים

    תמיכה בהקשר של עד 131,072 טוקנים מאפשרת לעבד קבצים גדולים במיוחד באמצעות מנגנון YaRN.

איפה זה נופל

המודל רגיש מאוד להגדרות הדגימה. שימוש ב־greedy decoding מוביל לקריסה בביצועים וללולאות טקסט אינסופיות, וחייבים להגדיר presence_penalty של 1.5 כדי שהגרסאות המכומתות לא יחזרו על עצמן. הבעיה היא שהעלאת הערך הזה עלולה לגרום לערבוב שפות ולפגיעה באיכות. בנוסף, שימוש ב־YaRN סטטי ב־llama.cpp מקבע את הפקטור ופוגע בביצועים על טקסטים קצרים, ובהיסטוריית השיחה חובה לחתוך ידנית את תגיות המחשבה כדי לא לקלקל את ההקשר הבא.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם כדאי להפעיל את הרחבת ההקשר ל־131 אלף טוקנים כברירת מחדל?

לא. בכלי קוד פתוח כמו llama.cpp המנגנון מיושם בצורה סטטית, ולכן הפעלת פקטור הרחבה גבוה תפגע באיכות המודל על טקסטים קצרים ורגילים. עדיף להשאיר את המודל על 32,768 טוקנים ולהגדיר YaRN רק לקריאות שבאמת דורשות חלון ענק.

איך מונעים מהמודל לפלוט ג'יבריש או להיתקע בלולאות אינסופיות?

אל תשתמשו ב־greedy decoding בשום מצב. חובה להגדיר טמפרטורה של 0.6 או 0.7 בהתאם למצב, ולשמור על presence_penalty של 1.5 כדי לרסן חזרות מיותרות בגרסאות המכומתות.

איך מריצים

את קובצי ה־GGUF מריצים ישירות דרך llama.cpp או פקודת ollama בודדת. המודל מוצע בכימותים שנעים בין q4_K_M לבין q8_0. כדי להחזיק אותו בזיכרון, אפילו בכימות 4 ביט סביר, תצטרכו לפחות 24GB של VRAM בכרטיס מסך כדי שהכול ישב במאיץ וירוץ בקצב נורמלי, או שילוב של זיכרון מערכת מהיר.

אם אתם לא מחזיקים חומרה מתאימה, עדיף להשתמש בנקודת קצה מנוהלת בענן שתומכת ב־YaRN דינמי, במיוחד אם אתם מתכוונים לפתוח את ההקשר ל־131 אלף טוקנים ולא רוצים להתעסק בקונפיגורציות ידניות.

ollama run hf.co/Qwen/Qwen3-30B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו מחדש בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומציינים שינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗