GPT
Q

Qwen3.6-40B-Grand-Intelligence-Fable-Fusion-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

קוד פתוח

DavidAUapache-2.02026-08-09

  • gguf
  • unsloth
  • fine tune
  • heretic
  • uncensored

הרחבה ומיזוג של דגמי Qwen לגודל 40B שנועדו להוריד מגבלות סירוב ולחזק יכולות הסקה וראייה. הוא מיועד למי שמחפש מודל מקומי פתוח בלי צנזורה רגילה ועם תמיכה בחיזוי רב טוקנים.

  • 267 GBמשקל הקבצים
  • 65,527הורדות בחודש
  • 42לייקים

מה זה

מדובר במיזוג רב שלבי של גרסאות Fable Fusion שמבוססות במקור על בסיס Qwen, תוך הרחבת הפרמטרים מ־27B ל־40B באמצעות Unsloth ואימון על מאגרי נתונים שונים. הדגם מציע חלון הקשר של 262,144 טוקנים ויכולת עיבוד תמונה וטקסט. המפתח מדווח על שיפור במבחני ביצועים מול דגמי 27B ו־35B, תוך שימוש במחצית מכמות טוקני החשיבה לעומת דגמי הבסיס.

הייחוד כאן הוא השילוב בין הסרת סירובים לבין אריזת GGUF מבוססת MTP וכיול Imatrix, כאשר שכבת ה־output tensor נשמרת ברמת 16 ביט. המשמעות היא ניסיון לשמור על חדות הפלט גם בכיולים נמוכים, לצד יכולת מובנית להבין תמונות אם מצרפים את קובץ ה־mmproj המתאים.

מתאים ל

  • הרצת צ'אט מקומי ללא סירובים

    מתאים לשימוש מקומי בתוכנות כמו LMStudio או KoboldCpp כשרוצים מענה חופשי ללא חסימות מערכת.

  • ניתוח תמונות וטקסט מקומי

    מספק יכולת ראייה ופענוח נתונים ישירות מהמחשב, בתנאי שמורידים את קובץ הראייה הנפרד.

  • כתיבה מונחית עם הקשר ארוך

    תומך בחלון הקשר של 256k ומיועד לטקסטים מפורטים בלי לאבד את היסטוריית השיחה.

איפה זה נופל

ההסרה של מנגנוני הסירוב לא הופכת אותו לקיצוני באופן אוטומטי. הכרטיס מציין במפורש שברירת המחדל שלו מתונה, וכדי להוציא ממנו תוכן בוטה, קללות או שפה חריפה צריך לדחוף אותו עם הנחיות מפורשות ומילות סלנג, אחרת הטקסט יישאר יבש.

בנוסף, ביצועי MTP תלויים מאוד בהגדרות. העלאת הטמפרטורה מעל 1.0 או שינוי של repetition penalty פוגעים ישירות בקצב הייצור שלו. הוא מוגדר רשמית לאנגלית וסינית בלבד, כך שאין שום הבטחה לעברית תקינה, ועיבוד תמונה לא יעבוד כלל מהקובץ הבודד בלי הגדרה ידנית של רכיב הראייה.

שאלות
נפוצות

מה עדיף להוריד, גרסת MTP או גרסה רגילה?

אם אתם עובדים בטמפרטורה של עד 1.0 ובמשימות שיחה ארוכות, גרסת ה־MTP תיתן מהירות גבוהה יותר. אם אתם עולים בטמפרטורה למשימות יצירתיות או רואים שהמהירות יורדת, עדיף להוריד את קובץ ה־GGUF הרגיל.

למה המודל לא מנתח לי תמונות אחרי שהורדתי את הקובץ?

קובץ ה־GGUF של המשקלים לבדו אינו כולל את מודול הראייה בפועל. כדי להפעיל עיבוד תמונה חובה להוריד קובץ mmproj תואם ולמקם אותו באותה התיקייה של המודל.

איך מריצים

כדי להריץ את גרסאות ה־4 ביט כמו Q4_K_S תצטרכו כרטיס מסך חזק ברמת RTX 5090 שבו נמדדו כ־50 עד 65 טוקנים לשנייה, או חלוקת שכבות בין זיכרון המעבד לכרטיס מסך. קיימת גרסת IQ2_XXS שמיועדת לכרטיסי 16GB ומטה, אך איכות הפלט בה תרד משמעותית. שימו לב שאם רוצים יכולות ראייה, חובה להוריד בנפרד קובץ mmproj יחיד ולהניח אותו באותה התיקייה.

יש שני סוגי קבצים: רגילים וגרסאות MTP. אם אתם עובדים בטמפרטורה מעל 1.0 או ששיעור קבלת הטוקנים יורד מתחת ל־50 אחוז, עדיף להישאר עם ה־GGUF הרגיל. אם אין לכם לפחות 24GB של זיכרון וידאו פנוי לחלוקה סבירה, עדיף לפנות ל־API מסחרי מאשר לסבול זמני תגובה איטיים במחשב האישי.

ollama run hf.co/DavidAU/Qwen3.6-40B-Grand-Intelligence-Fable-Fusion-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית ללא תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. עם זאת, מכיוון שמדובר במיזוג מורכב של מספר דגמים ומאגרי נתונים שונים, כדאי לוודא שאין סתירות מול תנאי השימוש של רכיבי המקור לפני שמטמיעים אותו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗