GPT
Q

Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF

קוד פתוח

hesamationapache-2.02026-04-18

  • gguf
  • llama.cpp
  • qwen
  • qwen3.6
  • qwen3_5_moe

גרסת GGUF שעברה אימון על שרשראות חשיבה בסגנון קלוד אופוס 4.6. היא מיועדת למי שרוצה להריץ מקומית מודל שחושב צעד אחרי צעד לפני שהוא עונה.

  • 104 GBמשקל הקבצים
  • 323,633הורדות בחודש
  • 292לייקים

מה זה

מדובר בהסבה לקובצי GGUF של מודל שעבר כוונון עדין על בסיס Qwen3.6-35B-A3B. היוצר לקח דאטה־סטים שמכילים דוגמאות חשיבה של קלוד אופוס 4.6 לצד דוגמאות של קוון, ואימן עליהם את שכבות ה־Attention בלבד באמצעות LoRA במשך 762 צעדים. הפלט עובד עם תבנית השיחה qwen3-thinking כדי לייצר תהליך חשיבה מפורט לפני המענה.

במבחן MMLU-Pro המודל הממוזג הציג זינוק מ־42.86% של מודל הבסיס ל־75.71%, כלומר תוספת של 32.85 נקודות אחוז. עם זאת, הבדיקה נעשתה על מדגם זעיר של 70 שאלות בלבד, 5 שאלות מתוך 14 נושאים. המפתח בעצמו מבהיר שמדובר בבדיקת עשן ראשונית ולא בבנצ'מרק מלא, כך שאי אפשר להסתמך על המספר הזה כהוכחה ליכולת אמיתית בשטח.

מתאים ל

  • פתרון בעיות לוגיות מקומי

    אימון ייעודי על נתוני חשיבה מורכבים מספק תהליך ניתוח מפורט מבוסס טקסט בלי לשלוח מידע לרשת.

  • ניפוי שגיאות בקוד באופליין

    יכולת פירוק שלבים בסגנון אופוס מאפשרת מעקב אחרי באגים בסביבות פיתוח סגורות.

  • מחקר על זיקוק ידע

    בדיקת ההשפעה של אימון LoRA ממוקד על שכבות Attention מול מודל בסיס רחב.

איפה זה נופל

האימון היה טקסטואלי בלבד. למרות שלמודל הבסיס יש יכולות ראייה, כאן לא אימנו בכלל על תמונות או וידאו, כך שכל התנהגות מולטימדיה נשארה לא מכווננת. המודל מוגדר רשמית לאנגלית בלבד, ולכן בדיקות בעברית עלולות להניב פלטים מוזרים או תרגום קלוקל של שרשרת החשיבה. בנוסף, המדגם שנבדק במבחנים היה מזערי, כך שאין שום ערבות לדיוק במשימות מורכבות.

אותה משפחה

Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לשלוח למודל הזה תמונות?

עדיף שלא. למרות שארכיטקטורת הבסיס כוללת רכיב ראייה, כוונון העדין הזה נעשה על טקסט בלבד ללא דוגמאות מולטימדיה. היכולת לא שופרה או נבדקה באימון הזה.

כמה זיכרון דרוש כדי להריץ אותו בפועל?

עבור כימות Q4_K_M תצטרכו כרטיס עם כ־24 גיגה זיכרון כדי להריץ את המודל בהקשר קצר. לגרסאות Q6_K או Q8_0, או כדי לנצל את מלוא ההקשר שמגיע ל־32,768 טוקנים, תצטרכו לפחות 48 גיגה של זיכרון גרפי.

האם המודל מתאים לעבודה בעברית?

המודל מתועד ומאומן על דאטה באנגלית בלבד. הוא עשוי להבין קלט בסיסי בעברית בגלל מודל הבסיס, אך שרשראות החשיבה ודיוק המענה בשפה לא נבדקו ועלולים להיות ירודים.

איך מריצים

ההרצה נעשית דרך llama.cpp או סביבות שתומכות בפורמט GGUF ובארכיטקטורת Qwen3.6. המאגר כולל קבצים בנפח כולל של 104 גיגה־בייט שמחולקים לכמה רמות כימות. גרסת Q4_K_M היא הקטנה ביותר שמתאימה להרצה מקומית, Q5_K_M מציעה איזון טוב יותר, Q6_K דורשת יותר זיכרון, ו־Q8_0 היא הכבדה ביותר ושומרת על איכות הקרובה למקור.

כדי להריץ מודל של 35 מיליארד פרמטרים תצטרכו כרטיס מסך עם לפחות 24 עד 48 גיגה־בייט זיכרון גרפי, תלוי בכימות ובאורך ההקשר שמגיע עד 32,768 טוקנים. אם אין לכם חומרה כזו ייעודית, ניסיון לדחוף את זה למעבד או לזיכרון מערכת איטי ייגמר בקצב יצירה בלתי שמיש, ובמקרה כזה עדיף לשלם לפי טוקן ב־API חיצוני.

ollama run hf.co/hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו בחופשיות. התנאים היחידים הם שמירה על הודעת זכויות היוצרים והצהרה על שינויים שבוצעו בקוד או במשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗