GPT
Q

Qwen3.8-27B-Uncensored-OrcaRouter-GGUF

קוד פתוח

chimingwapache-2.02026-08-15

  • safetensors
  • gguf
  • llama.cpp
  • qwen3.8
  • fp8

גרסת GGUF למודל חזותי ושפתי של 27B שנוטרלו ממנו מנגנוני הסירוב המובנים. הוא עונה על שאלות שמודלים רגילים דוחים, ותומך בהרצה מקומית דרך llama.cpp.

  • 165 GBמשקל הקבצים
  • 241,058הורדות בחודש
  • 71לייקים

מה זה

מדובר במודל שמבוסס על סדרת Qwen3.8 בגודל 27 מיליארד פרמטרים, המשלב עיבוד טקסט ותמונות יחד. המקור עבר תהליך הסרת סירובים, מה שאומר שהוא מציית להוראות ישירות בלי מחסומי הבטיחות הסטנדרטיים של היצרן המקורי. בנוסף הוא כולל תמיכה בהפעלת כלים, תהליכי חשיבה וחלון הקשר תיאורטי של עד 262K טוקנים.

הריפו הזה אינו אימון מחדש אלא המרה של גרסת הבלוקים FP8 של OrcaRouter לפורמט GGUF. המשקלים נפרסו תחילה לפורמט BF16 וממנו כווצו לארבע רמות דיוק נפרדות, ללא שימוש במטריצת חשיבות. קיים כאן גם קובץ נפרד של Multi-Token Prediction בדרגת Q8_0 שנועד לשמש כמודל טיוטה להאצת הסקת המסקנות.

בבדיקת תאימות מוגבלת שבוצעה על כרטיס RTX 4090 עם 24GB זיכרון, קובץ ה־MTP השיג קבלת טוקנים של כמעט 80 אחוזים בשישה פרומפטים מוגדרים. הנתון הזה מוכיח תאימות טכנית בסיסית וריצה עקבית, אך הוא לא מהווה מדד לאיכות התוכן או ליכולות המודל במשימות מורכבות.

מתאים ל

  • מחקר אבטחת מודלים

    בדיקת התנהגות מודל ללא מנגנוני סירוב וניתוח תגובות לפרומפטים קיצוניים בסביבה מבוקרת.

  • ניתוח מסמכים ותמונות

    שילוב תמונות עם טקסט דרך מקרן ייעודי לצורך חילוץ מידע מקומי ללא שליחת מידע החוצה.

  • פיתוח עם פקודות מערכת

    עבודה מול כלים וקוד כשהמודל אינו עוצר על אזהרות בטיחות שווא שקיימות במודלי בסיס.

איפה זה נופל

השורשים של המודל הזה מגיעים ממשקלי FP8, כך שההרחבה ל־BF16 והכיבוץ מחדש ל־GGUF לא מחזירים דיוק שאבד במקור. הכיבוץ נעשה בלי imatrix, מה שעלול לפגוע באיכות הפלטים בחלק מהמשימות.

החיסרון המרכזי הוא היעדר מוחלט של שכבות בטיחות. הוא מסוגל לפלוט תוכן פוגעני, שגוי או מסוכן בלי לחשוב פעמיים, כך שאסור לחבר אותו ישירות למשתמשי קצה בלי מנגנון סינון חיצוני משלכם. בנוסף, אין בדיקות ביצועים מקיפות לעברית או ליכולות קוד ספציפיות בגרסה הזו.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי בודד?

כן, אבל רק בגרסאות המכווצות כמו Q4_K_M ועל כרטיס עם 24GB זיכרון. אם תרצו לפתוח חלון הקשר גדול או להוסיף עיבוד תמונות, הזיכרון עלול להיגמר מהר מאוד.

בשביל מה צריך את קובץ ה־MTP שנמצא במאגר?

זהו קובץ טיוטה אופציונלי שנועד להאיץ את מהירות הפקת הטקסט ב־llama.cpp דרך פענוח ספקולטיבי. הוא לא עובד כמודל צ'אט עצמאי וחייבים להריץ אותו יחד עם הקובץ הראשי.

האם המודל מבין ומייצר עברית בצורה טובה?

הוא הוגדר רשמית לאנגלית ולסינית בלבד. הוא עשוי לקלוט עברית ברמה מסוימת בזכות מודל הבסיס, אך אין עליה התחייבות והביצועים לא נבדקו בריפו הזה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 24GB זיכרון וידאו, כמו RTX 3090 או 4090, וגם אז תישארו עם מקום מוגבל לקונטקסט ארוך. גרסת Q4_K_M היא נקודת ההתחלה המעשית למשתמש יחיד. אם המטרה היא קוד או הפעלת כלים, כדאי לכוון לגרסת Q5_K_M או לגרסאות הכבדות יותר, בתנאי שיש לכם מספיק זיכרון משותף או מספר כרטיסים.

בשביל עיבוד תמונות חובה להוריד בנפרד את קובץ המקרן מתיקיית AUX ולהעביר אותו עם הדגל mmproj. אם אתם זקוקים להקשר מלא של מאות אלפי טוקנים או שאין לכם חומרה ייעודית, עדיף להשתמש ב־API מרוחק במקום להיאבק בהרצה מקומית כבדה.

ollama run hf.co/chimingw/Qwen3.8-27B-Uncensored-OrcaRouter-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

48 קבצים במאגר, 165 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המקורי. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הקבצים, בתנאי ששומרים על הודעות זכויות היוצרים וההצהרה המקורית. מאחר שמנגנוני הסירוב הוסרו, האחריות המלאה על אופי השימוש והתוצרים חלה על מי שמריץ ומפיץ אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗