GPT
Q

Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF

קוד פתוח

DavidAUapache-2.02026-08-09

  • gguf
  • unsloth
  • fine tune
  • heretic
  • uncensored

הרחבה ומיזוג של דגמי Qwen ל־40 מיליארד פרמטרים עם הסרת צנזורה. המודל מתאים למי שרוצה חשיבה מפורטת ויכולות ראייה בלי חסימות תוכן של ספקים מסחריים.

  • 527 GBמשקל הקבצים
  • 75,257הורדות בחודש
  • 56לייקים

מה זה

מדובר בפרויקט מיזוג מורכב שהרחיב את בסיס Qwen מ־27 מיליארד פרמטרים לנפח של 40 מיליארד, תוך שילוב משקלים מדגמים שונים ותהליך הסרת צנזורה. היוצר כיוון להשיג רמת ניתוח עמוקה עם בלוק חשיבה קצר יותר, בין עשירית לחצי מכמות הטוקנים שדגמי חשיבה אחרים דורשים כדי להגיע למסקנה.

לפי כרטיס המודל, בבדיקות של 4 ביט ו־8 ביט הגרסה הזו עוקפת את Qwen 3.6 27B המקורי בשישה מתוך שבעה מבחנים ומשתווה לו בשביעי, ובנוסף עוקפת את גרסת ה־35B בכל שבעת המבחנים. בפועל, המשמעות היא חדות גבוהה יותר במעקב אחר הוראות מורכבות ופחות מלל מיותר בשלב החשיבה הפנימי, לצד יכולת ניתוח טקסט ותמונה באותו מודל.

מתאים ל

  • כתיבה יצירתית ללא סינון

    מייצר סצנות עלילתיות ואפלות בלי סירובים אוטומטיים של ספקי ענן מסחריים.

  • ניתוח מסמכים ותמונות מקומי

    משלב מודל ראייה עם חלון הקשר רחב לצורך עיבוד מידע רגיש על החומרה שלכם.

  • מענה טכני עם חשיבה קצרה

    מנתח בעיות מורכבות תוך ניצול פחות טוקנים של חשיבה פנימית בהשוואה לדגמים מקבילים.

איפה זה נופל

למרות שהמודל מוגדר כנטול צנזורה, הכרטיס מודה במפורש שברירת המחדל שלו מתונה מאוד. הוא לא יסרב לבקשות של תוכן בוטה, קללות או אימה, אבל כדי לקבל תוצאה מפורטת ולא יבשה צריך לדחוף אותו עם מילות מפתח והנחיות מפורשות. בנוסף, מדובר במיזוג רב-שלבי ולא באימון מאפס, ולכן עלולים לצוץ עיוותים לא צפויים בהיגיון שלא היו במודל הבסיס הרשמי. השפות המוגדרות הן אנגלית וסינית, כך שביצועים בעברית אינם מובטחים ולא נבדקו.

שאלות
נפוצות

איזו גרסה עדיף להוריד, רגילה או חיזוי טוקנים מרובה?

אם אתם עובדים בטמפרטורה של עד 1.0 וחשובה לכם מהירות, גרסת החיזוי יכולה לעבור 65 טוקנים לשנייה. לטמפרטורות גבוהות, כתיבה יורדת לפרטים או אם יחס הקבלה נמוך מחצי, הגרסה הרגילה תרוץ מהר ויציב יותר.

האם המודל יפעל כראוי על כרטיס עם 16 גיגה בייט זיכרון?

הוא יעלה בעזרת קוונט IQ2, אבל איכות הפלט תהיה בינונית למדי. לתוצאות טובות באמת כדאי לבחור בגרסת 4 ביט ולפרוק חלק מהעומס לזיכרון הראשי של המחשב.

למה המודל לא מנתח תמונות מיד לאחר ההורדה?

קובץ המודל הראשי כולל את הטקסט בלבד. כדי להפעיל יכולות תמונה, צריך להוריד בנפרד קובץ תואם ולהניח אותו באותה תיקייה שבה נמצא קובץ ה־GGUF.

איך מריצים

המשקל הכולל של כלל קובצי המאגר עומד על 527 גיגה בייט בפורמט GGUF, אבל מורידים קובץ ספציפי לפי כמות הזיכרון שיש לכם. קיימות גרסאות רגילות וגרסאות עם חיזוי מרובה טוקנים. בגרסת 4 ביט על כרטיס 5090 תחת ווינדוס דווחה מהירות של כ־50 טוקנים לשנייה בגרסה הרגילה, ומעל 65 טוקנים לשנייה בגרסת החיזוי כשיחס הקבלה עובר 50 אחוזים.

גרסת IQ2 מיועדת לכרטיסי 16 גיגה בייט, אך היוצר מציין שהאיכות שם סבירה בלבד וממליץ לעלות לפחות לגרסת 4 ביט גם במחיר של פריקת חלק מהשכבות למעבד ולזיכרון המחשב. כדי להפעיל עיבוד תמונה חובה להוריד בנפרד קובץ תואם ולשים אותו באותה תיקייה. אם אין לכם כרטיס מסך חזק, הרצה מקומית של 40 מיליארד פרמטרים תהיה איטית, ובמקרה כזה שווה לשקול שירות ענן.

ollama run hf.co/DavidAU/Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

28 קבצים במאגר, 527 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי קוד והפצה מחדש, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. עם זאת, המודל משלב נתונים ומודלים קודמים, ולכן יש לוודא שהשימוש בפועל אינו סותר מגבלות של חלקי המקור שמוזגו לתוכו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗