GPT
Q

Qwen3-8B-192k-Josiefied-Uncensored-NEO-Max-GGUF

קוד פתוח

DavidAUapache-2.02025-05-06

  • gguf
  • 192k context
  • reasoning
  • thinking
  • qwen3

גרסה נטולת צנזורה של מודל שמונה מיליארד פרמטרים עם חלון הקשר מורחב של 192 אלף טוקנים. הוא נבנה למי שצריך תהליכי חשיבה עמוקים ומענה ללא חסימות על תכנים קשים.

  • 72.2 GBמשקל הקבצים
  • 3,583הורדות בחודש
  • 61לייקים

מה זה

המודל הזה הוא עיבוד של Josiefied-Qwen3-8B-abliterated-v1, שעבר הרחבת הקשר מ־32 אלף ל־192 אלף טוקנים בעזרת שיטת YARN. היוצר המיר אותו לפורמט GGUF בכיול מבוסס NEO Imatrix, כשטנסור הפלט נשמר בדיוק של 16 ביט כדי למנוע הידרדרות באיכות התשובות וההיגיון הפנימי. הוא מתמקד ביכולת לעבד כמויות גדולות של טקסט במקביל לפעולת חשיבה מפורטת בתוך תגיות ייעודיות.

ההבדל המרכזי מול מודלים רגילים בגודל שמונה מיליארד הוא הסרת מנגנוני הסירוב לחלוטין. הכרטיס מזהיר במפורש מפני שפה בוטה, אימה ותכנים גרפיים עזים ללא שום סינון. במקום לעצור ולהטיף מוסר על בקשות מורכבות, הוא מתחיל לחשוב מיד ומייצר סצנות שלמות בלי מעצורים, תכונה שמתאימה מאוד למי שבונה משחקי תפקידים או כותב סיפורת אפלה.

מתאים ל

  • כתיבת סיפורת ואימה

    הוא מייצר תיאורים גרפיים מפורטים ועלילות מתח בלי להפעיל מסנני תוכן מוסרניים באמצע הכתיבה.

  • משחקי תפקידים מורכבים

    הזיכרון הגדול מאפשר לשמור היסטוריית משחק ארוכה מאוד בלי לאבד את ההקשר של הדמויות.

  • פתרון בעיות הדורשות עומק

    הוא מפעיל בלוקי חשיבה פנימיים ארוכים כדי לפרק שאלות סבוכות לפני הצגת התשובה.

איפה זה נופל

בגלל הסרת המחסומים המוחלטת, המודל אינו כולל שום מנגנון בטיחות ומסוגל לפלוט קללות, אלימות גרפית ותיאורים קשים ללא התרעה מוקדמת. לא מדובר בכלי שאפשר לחבר ישירות לממשק של לקוחות קצה בארגון. בנוסף, חלון ההקשר העצום נמתח באמצעות התאמות ולא אומן מראש על נפח כזה, מה שעלול לייצר ירידה בעקביות הטקסט כשמתקרבים לקצה הטווח. המפתח אף ממליץ להגדיר חלון מינימלי של 8 עד 16 אלף טוקנים רק עבור שלב החשיבה הפנימית.

שאלות
נפוצות

למה לוקח לו כל כך הרבה זמן להתחיל להגיב?

המודל מתוכנן לייצר בלוק חשיבה עצמאי ארוך מאוד שבו הוא מתלבט עם עצמו לפני כתיבת הפלט. בדוגמת הריצה שבתיעוד, שלב החשיבה בלבד לקח כמעט דקה שלמה, וזהו חלק מובנה מההתנהגות שלו ולא תקלה בביצועים.

האם הוא מתאים לשימוש באפליקציה עם לקוחות אמיתיים?

לא בלי שכבת סינון קפדנית שבניתם בעצמכם. המודל פותח במכוון בלי מחסומי צנזורה ומייצר תכנים בוטים, קללות ותיאורים אלימים מאוד ברגע שההקשר מאפשר זאת.

איזו גרסה מומלץ להוריד מתוך כל הקבצים?

המאגר מכיל קבצים רבים בדרגות דחיסה שונות. עבור חומרה ביתית טיפוסית גרסת IQ3_M מספקת פשרה סבירה בין משקל המודל לאיכות הפלט, בעוד שגרסאות כבדות יותר ידרשו נפחי זיכרון שאינם נגישים בכל מחשב.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־72.2 ג'יגה־בייט המחולקים ל־18 קבצים שונים, המייצגים רמות כיול מגוונות מ־IQ3_M ועד גרסאות מלאות יותר. להרצת קוונט בינוני תצטרכו כרטיס מסך עם לפחות 8 עד 12 ג'יגה־בייט של זיכרון וידאו, בעוד שהרצת ההקשר המלא של 192 אלף טוקנים תדרוש משאבי זיכרון ענקיים שיחייבו שרתי ענן או שימוש בזיכרון מעבד אטי בהרבה.

ההרצה המקומית נבדקה בתוכנות כמו LM Studio באמצעות תבניות Jinja או ChatML. אם המטרה היא מענה מהיר של שניות בודדות ולא כתיבה יצירתית ממושכת, המודל הזה יעייף אתכם, שכן בלוק החשיבה הפנימי שלו יכול לקחת דקה שלמה עוד לפני שמתחילה הפליטה של המילה הראשונה.

ollama run hf.co/DavidAU/Qwen3-8B-192k-Josiefied-Uncensored-NEO-Max-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש בלי תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והצהרת הוויתור על אחריות. אין כאן הגבלה חוקית על שילוב שלו במוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗