GPT
Q

Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF

קוד פתוח

DavidAUapache-2.02026-09-01

  • gguf
  • unsloth
  • fine tune
  • heretic
  • uncensored

גרסת קוד פתוח ללא צנזורה שעברה אופטימיזציה אגרסיבית לקיצור שלבי החשיבה המיותרים. היא מתאימה למי שרוצה מהירות חריגה ומענה ישיר למשימות פיתוח וכתיבה מורכבות.

  • 395 GBמשקל הקבצים
  • 348,753הורדות בחודש
  • 420לייקים

מה זה

מדובר בשילוב של כוונון עדין ומיזוג מודלים על בסיס קוון, שמטרתו המרכזית היא לחתוך את בלוקי החשיבה בשיעור שנע בין חצי ל־90 אחוז ביחס למקור. במקום לשרוף אלפי טוקנים על תכנון והתלבטויות עימוד, הוא עובר ישר לפלט ומעביר את פירוט החשיבה ישירות לתוכן הסופי.

במבחני ביצועים נרשם ציון ARC-C של 0.735 בגרסת שמונה ביט ו־0.719 בארבעה ביט, לצד 0.882 ב־ARC-E. המספרים האלה מציבים אותו קרוב מאוד למודלים מסחריים סגורים, כאשר בפועל המשמעות היא פתרון בעיות קשות ויכולת מעקב אחר הוראות מורכבות ברמה גבוהה בהרבה מהמודל הגולמי, בלי להמתין דקות ארוכות לכל תשובה.

מתאים ל

  • כתיבת קוד מהירה

    חיתוך טוקני החשיבה מפיק פתרונות תכנות באופן מיידי, ללא המתנה מיותרת לשלבי ניתוח ארוכים.

  • סוצי אינטראקציה לא מצונזרים

    הסרת מגבלות הסירוב מאפשרת לנהל שיחות חופשיות ומשחקי תפקידים ללא חסימות מובנות.

  • הפעלת כלים ופונקציות

    ביצועי tool calling חזקים במיוחד בכימותים של Q5 ומעלה בטמפרטורה מתונה.

איפה זה נופל

הקיצוץ הדרסטי בחשיבה גורם לו לקפוץ מיד לתשובה בלי לבדוק את עצמו פעמיים, מה שמחייב פרומפטים מפורטים ומדויקים מאוד כדי למנוע טעויות. בנוסף, אף שהמודל מוגדר כלא מצונזר ושיעור הסירובים ירד ל־11 מתוך 100 בשלב הסופי, ברירת המחדל שלו יבשה ומאופקת. כדי להוציא ממנו שפה בוטה, קללות או תוכן גרפי, תצטרכו לדחוף אותו ידנית ולהגדיר בדיוק באילו מילים להשתמש. כמו כן, בכימותים נמוכים מ־Q4KM קריאות לכלים ולפונקציות עלולות להשתבש.

שאלות
נפוצות

איזו גרסת קובץ כדאי להוריד, רגילה או MTP?

הורידו את שתיהן לבדיקה קצרה. גרסת MTP מגיעה למהירויות גבוהות יותר, אך אם יחס קבלת הטוקנים יורד מתחת לחצי או שאתם עובדים בטמפרטורה גבוהה מאחת, הגרסה הרגילה תהיה יציבה ומהירה יותר.

איך מחזירים למודל יותר זמן חשיבה אם התוצאה שטחית?

אפשר לעדכן את תבנית הג'ינג'ה ולהגדיר reasoning_effort לרמה הרצויה, או פשוט לבקש בפרומפט לבדוק את הפרטים בקפידה לפני מתן המענה. הנחיה ברורה גורמת לו להרחיב את שלב החשיבה לפני הפלט.

האם המודל תומך בתמונות ישר מהקופסה?

היכולת קיימת במודל, אך בקובצי GGUF היא לא תעבוד לבד. חובה להוריד בנוסף קובץ mmproj תואם ולשים אותו באותה תיקייה יחד עם המודל כדי לעבד קלט חזותי.

איך מריצים

המודל שוקל כ־395 גיגה־בייט על פני 29 קובצי GGUF, ומציע חלון הקשר של 256 אלף טוקנים. כדי להריץ כימות כמו Q4_K_S תצטרכו כרטיס גרפי חזק ברמת RTX 5090, שעליו נמדדה מהירות של 75 טוקנים לשנייה, או מעל 90 טוקנים בגרסאות MTP. אם אתם מתכננים לעבוד עם תמונות, חובה להוריד בנפרד קובץ mmproj מתאים לאותה תיקייה.

קיימות שתי גרסאות מרכזיות, רגילה ו־MTP לחיזוי מרובה טוקנים. מומלץ לבדוק את שיעור קבלת הטוקנים, ואם הוא נופל מ־50 אחוז או שאתם עובדים בטמפרטורה מעל 1, חזרו לגרסה הרגילה. אם אין לכם חומרה ייעודית עם זיכרון וידאו מסיבי, קריאה ל־API תהיה זולה ומעשית פי כמה מהרצה עצמאית של 27 מיליארד פרמטרים.

ollama run hf.co/DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 395 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא אפאצ׳י 2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה של המודל בתוך מוצרים ללא תמלוגים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, והוספת הצהרה על כל שינוי שבוצע בקבצים. הוא נוח מאוד להטמעה במוצרי תוכנה עצמאיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗