GPT
Q

Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

קוד פתוח

DavidAUapache-2.02026-05-01

  • gguf
  • unsloth
  • fine tune
  • heretic
  • uncensored

גרסה מורחבת ל־40 מיליארד פרמטרים של קוון שעברה אימון להסרת מגבלות תוכן ושילוב דאטה־סטים של קלוד. מתאים למי שחייב מודל מקומי שלא מסרב לבקשות וכותב בלי פילטרים.

  • 242 GBמשקל הקבצים
  • 488,865הורדות בחודש
  • 737לייקים

מה זה

הבסיס כאן הוא מודל קוון 3.6 של 27 מיליארד פרמטרים שהורחב ידנית למבנה דחוס של 40 מיליארד פרמטרים, עם 96 שכבות ו־1275 טנזורים. תהליך האימון בוצע באנסלות' וכלל הסרת מנגנוני סינון דרך Heretic, הטמעת דאטה־סטים פנימיים בשם Deckard להקניית סגנון בוטה ועמוק, וזיקוק מנתוני קלוד 4.6 אופוס לייצוב החשיבה. המודל תומך בחלון הקשר של 256 אלף טוקנים ומכיל יכולת עיבוד תמונה אם מצרפים קובץ mmproj מתאים.

במדדי ההערכה של יוצר הפרויקט במצב instruct, גרסת ה־mxfp8 מציגה תוצאה של 0.651 ב־arc-c ו־0.816 ב־arc/e, שיפור קל מאוד לעומת 0.647 ו־0.803 בקוון 27B המקורי. הפער הזה מראה שההרחבה ל־40B לא הכפילה את היכולות אלא בעיקר שמרה על ביצועי המקור תוך שינוי חד של סגנון הכתיבה והסרת הגבולות.

מתאים ל

  • כתיבה יצירתית ללא סינון

    מאפשר כתיבת עלילה מחוספסת ותוכן למבוגרים בלי סירובים מלאכותיים של מנגנוני בטיחות.

  • פיתוח קוד בשרתי בדיקה

    מציע יכולות הסקת מסקנות וקוד מתוך זיקוק של קלוד בסביבה מקומית מנותקת מרשת.

  • ניתוח מסמכים ותמונות

    תומך בחלון הקשר של 256K טוקנים ועיבוד ויזואלי להרצה על מאגרי מסמכים ארוכים.

איפה זה נופל

המודל נוטה ללולאות וחזרות בלתי נגמרות אם עובדים עם קוואנטים נמוכים או עם פרומפטים קצרים וריקים מתוכן. כדי לייצב אותו נדרש פרומפט מערכת קונקרטי, או העלאה של ערך ה־repetition penalty לטווח של 1.05 עד 1.1. בנוסף, הסרת הסינון מוחלטת, כך שאין שום מנגנון בטיחות שימנע פלט פוגעני או רעיל, מה שהופך אותו ללא מתאים לחלוטין למוצרים שפונים ישירות למשתמשי קצה או לציבור.

שאלות
נפוצות

האם המודל מתאים לתקשורת בעברית?

השפות המדווחות הן אנגלית וסינית בלבד. הוא מסוגל לקלוט עברית בזכות הבסיס של קוון, אך הפלט יהיה פחות מדויק ועשוי לסבול משגיאות תרגום ותחביר.

איזה קובץ חובה להוריד כדי שעיבוד התמונה יעבוד?

הטקסט בלבד עובד מקובץ ה־GGUF, אך לפענוח תמונות חובה להוריד קובץ mmproj תואם ולהניח אותו באותה התיקייה של המודל.

איך מונעים מהמודל לחזור על משפטים שוב ושוב?

יש לוודא שהפרומפט מפורט, להגדיר פרומפט מערכת קצר אפילו של משפט אחד, ולהעלות repetition penalty ל־1.05 או 1.1 אם עובדים בקוואנט נמוך.

איך מריצים

הריצה המקומית דורשת משאבים רציניים של זיכרון וידאו. מודל מלא בגודל 40B בגרסת Q4 דורש כ־24 עד 28 גיגה־בייט זיכרון רק למשקולות, ועוד תוספת גדולה אם מנצלים הקשר ארוך מתוך 256K הטוקנים הנתמכים. גרסאות נמוכות כמו IQ2_M מגיעות לפי נתוני הפרויקט ל־83% מרמת הדיוק המקורית, IQ4XS מגיע ל־94%, ו־Q8_0 שומר על 98.4%.

ליוצרי תוכן או אנשי בדיקות חדירה שחייבים מודל לא מסונן, הרצה על גבי כרטיסים כמו A100 או זוג כרטיסי RTX 3090/4090 ביתיים היא הפתרון היחיד. לעומת זאת, אם אתם מחפשים קוד נטו או מענה למשימות סטנדרטיות באנגלית, שירותי ענן של מודלים מסחריים יספקו לכם תפוקה מהירה פי כמה בלי להשקיע בחומרה מקומית כבדה.

ollama run hf.co/DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח במאגר הוא Apache 2.0. הרישיון מאפשר שימוש חופשי, הפצה ושינוי, כולל לצרכים מסחריים, בכפוף להשארת הודעות זכויות היוצרים וכתב הוויתור על אחריות. עם זאת, בגלל שהמודל אומן על זיקוק פלטים של מודלים אחרים כמו קלוד, תאימות הרישיון המקורית למקורות המידע לא תמיד ברורה משפטית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗