GPT
N

Nail-Qwen3.6-35B-A3B-GGUF

קוד פתוח

peculiar-ragdollapache-2.02026-08-09

  • gguf
  • llama.cpp
  • qwen3_6
  • moe
  • token-efficient

גרסת GGUF מהירה של Qwen3.6-35B-A3B עם הנחיית מערכת מובנית שמונעת פטפוטים מיותרים. מתאימה למי שצריך תגובות חדות ומשימות פיתוח על חומרה צנועה יחסית.

  • 108 GBמשקל הקבצים
  • 22,528הורדות בחודש
  • 93לייקים

מה זה

מדובר בכימות של מודל MoE עם 3.4 מיליארד פרמטרים פעילים, שמבוסס על קוונטיזציה דינמית של Unsloth. היוצרים חיברו תבנית שיחה משופרת של froggeric עם הנחיית מערכת קבועה שמאלצת את המודל לירות תשובות קצרות וטכניות, בלי הקדמות ובלי נימוסים. הוא יודע לעבד גם תמונות אם מצרפים את קובץ הראייה המתאים.

במבחני ריצת קוד ופתרון בעיות הנדסת תוכנה עצמאית, המודל מציג דיוק זהה למודלים צפופים של 27 מיליארד פרמטרים, אבל מגיע לפתרון מהר פי שניים עד חמישה. במקום להשחית זמן על הסברים מנופחים, הוא חותך ישר לשורות הקוד. המשמעות ברורה. מקבלים תפוקת עבודה גבוהה בהרבה לכל יחידת זמן, במיוחד בפתרון בעיות עצמאיות בסוכן קוד.

מתאים ל

  • סוכן תיקון קוד מקומי

    פותר באגים במהירות שיא ופולט תיקונים נקיים בלי הסברים ארוכים שמעכבים את הסוכן.

  • עיבוד תמונות וטקסט ב־24GB

    ניתוח מולטימודלי מלא עם קובץ הראייה הנלווה, שרץ כולו על כרטיס מסך ביתי חזק.

  • משימות קצרות ומרובות

    מעולה לתיוג ועיבוד מקבילי שבהם התפוקה לכל שנייה חשובה יותר מאורך השיחה הכולל.

איפה זה נופל

המודל הזה שורף את חלון ההקשר שלו בקצב מדאיג. במבחן GPQA-Diamond הוא מוציא 5,777 טוקנים לשאלה לעומת 2,380 במודלים צפופים, בגלל תהליך חשיבה פנימי מפורט. זה אומר שבשיחה ארוכה ורציפה תגיעו לתקרת ההקשר הרבה לפני מודלים אחרים.

בנוסף, כל המדידות בכרטיס נלקחו על סביבת MLX במק ולא על קבצי ה־GGUF האלה. הנחיית המערכת המקצרת צרובה ישירות בתבנית השיחה, כך שאי אפשר לבטל אותה בקריאת API פשוטה בלי לערוך את הקובץ. עברית גם לא ברשימת השפות הנתמכות, שכוללת רק אנגלית וסינית.

שאלות
נפוצות

האם המודל יקשיב להנחיות המערכת שאני שולח לו?

כן, אבל ההנחיה המובנית נשארת פעילה. התבנית משמרת את ההנחיה שלכם ושמה אותה ראשונה, אבל מדביקה מיד אחריה את הוראות התמצות הקבועות. אם תנסו לבקש ממנו להיות מנומס או לכתוב הקדמות, ההנחיה הפנימית תגבר עליכם אלא אם תערכו את קובץ התבנית.

איזה קובץ בדיוק כדאי להוריד מהמאגר?

אם יש לכם כרטיס של 24 ג'יגה, בחרו ב־UD-Q4_K_S כדי לקבל מרווח בטוח להקשר, או ב־UD-Q4_K_XL לדיוק מעט טוב יותר. אל תורידו בלי תגית ספציפית ב־llama.cpp, כי המאגר ינסה למשוך קובץ ברירת מחדל שלא קיים שם. למשימות שכוללות תמונות, חובה להוריד גם את mmproj-F16.gguf.

איך מריצים

כדי להריץ אותו צריך כלי כמו llama.cpp עם תגית כימות מפורשת, למשל UD-Q4_K_XL שתופס 22.4 ג'יגה בייט ומתאים לכרטיס מסך עם 24 ג'יגה זיכרון כמו RTX 4090. אם כרטיס המסך שלכם מוגבל ל־16 ג'יגה, גרסת IQ3_S שוקלת 13.7 ג'יגה ותעלה לשם, אבל תאבדו איכות. גרסאות Q5 ו־Q6 דורשות מעל 26 ג'יגה ויצריכו כרטיסים מקצועיים או חלוקת זיכרון.

המפרסם לא מוכר גישה דרך שרת מנוהל ואין כאן מסלולי תשלום. אתם מורידים את המשקלים ומספקים את החומרה לבד. אם המחשב שלכם חלש מדי ולא מחזיק כרטיס עם לפחות 16 ג'יגה זיכרון גרפי, עדיף לפנות למודל שירות מרוחק במקום לנסות להריץ מקומית.

ollama run hf.co/peculiar-ragdoll/Nail-Qwen3.6-35B-A3B-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache-2.0, אותו רישיון פתוח שמגיע מדגם הבסיס. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו פנימית בארגון ולשלב אותו במוצרים. אין חובת תשלום תמלוגים, אבל צריך לשמור על הודעות זכויות היוצרים והרישיון המקוריות של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗