GPT
Q

Qwen3.5-27B-heretic-GGUF

קוד פתוח

mradermacherapache-2.02026-02-26

  • transformers
  • gguf
  • heretic
  • uncensored
  • decensored

גרסת קוונטיזציה בפורמט GGUF של מודל heretic בגודל 27 מיליארד פרמטרים. היא מיועדת להרצה מקומית על מעבד או כרטיס גרפי ביתי בלי להחזיק שרת יקר.

  • 174 GBמשקל הקבצים
  • 1,790הורדות בחודש
  • 48לייקים

מה זה

מדובר בהמרה של המודל coder3101/Qwen3.5-27B-heretic למבנה GGUF סטטי, שמתאים לטעינה מהירה בכלי הרצה כמו llama.cpp. הדף מציע חלוקה מקיפה של דרגות דחיסה, החל מגרסאות 2 ביט רזות ועד לגרסאות 8 ביט כבדות. בנוסף מצורפים קובצי mmproj ייעודיים בנפח של עד גיגהבייט אחד, שמיועדים לעבודה מול רכיבי מולטימודל.

היוצר ממליץ על גרסאות Q4_K_M ו־Q4_K_S כנקודת האמצע הנכונה בין מהירות לשמירה על איכות הטקסט. אם אתם מחפשים רמת דיוק גבוהה יותר, קיימת גרסת Q8_0 שדורשת 28.7 גיגהבייט, או גרסת Q6_K שנחשבת טובה מאוד לפי התיעוד ותופסת 22.2 גיגהבייט.

מתאים ל

  • הרצה מקומית על כרטיס יחיד

    גרסאות ה־4 ביט שוקלות סביב 16 גיגהבייט ומתאימות לכרטיס מסך עם 16 עד 24 גיגהבייט זיכרון VRAM.

  • ניסויי מולטימודל מקומיים

    המאגר כולל קובצי mmproj ייעודיים שמאפשרים חיבור לרכיבי קלט נוספים על גבי מנוע GGUF.

  • סביבות בדיקה ללא אינטרנט

    קובץ בודד ללא תלות ברשת מתאים לפיתוח מבודד שבו המידע לא יכול לצאת מחוץ למחשב.

איפה זה נופל

הכרטיס לא מספק נתוני בדיקות ביצועים, מדדי השוואה או פירוט לגבי אופן האימון של גרסת ה־heretic הזו, כך שאי אפשר לדעת מראש איך הוא מתנהג במשימות מורכבות. המודל מוגדר באנגלית בלבד, ואין שום מידע על תמיכה בעברית או על התנהגות עם שפות אחרות. מעבר לזה, גרסאות ה־3 ביט מוגדרות על ידי היוצר עצמו כבעלות איכות נמוכה, ולכן השימוש בהן צפוי לפגוע בדיוק של התשובות.

שאלות
נפוצות

איזו גרסה כדאי להוריד מתוך הרשימה?

היוצר מסמן את Q4_K_M בנפח 16.6 גיגהבייט ואת Q4_K_S בנפח 15.7 גיגהבייט כגרסאות מהירות ומומלצות שמאזנות בין גודל לאיכות. אם יש לכם מספיק זיכרון ואתם רוצים איכות גבוהה בלי פשרות, לכו על Q6_K או Q8_0 שתופס 28.7 גיגהבייט.

מה התפקיד של קובצי mmproj שנמצאים במאגר?

אלו קבצים שמיועדים להשלמת היכולות המולטימודליות של המודל. אם המערכת שלכם עובדת רק עם טקסט, אתם לא צריכים להוריד אותם אלא רק את קובץ המודל הרגיל.

איך מריצים

אתם צריכים סביבה שתומכת ב־GGUF, כמו llama.cpp או סביבות דומות שמשתמשות בספרייה הזו. המשקל של הקבצים מתחיל ב־10.2 גיגהבייט עבור Q2_K ומגיע עד 28.7 גיגהבייט ב־Q8_0, כך שתצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגהבייט זיכרון כדי להריץ את גרסאות ה־4 ביט המומלצות בצורה חלקה, או כמות גדולה של זיכרון RAM אם אתם מכוונים להרצה על מעבד בלבד.

אם אין לכם חומרה כזו זמינה ואתם צריכים זמני תגובה מיידיים, עדיף להשתמש במודלים מנוהלים דרך ספקי ענן במקום להילחם בטעינה של 27 מיליארד פרמטרים על זיכרון מקומי מוגבל.

ollama run hf.co/mradermacher/Qwen3.5-27B-heretic-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה של המודל, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗