GPT
Q

Qwen3.8-27B-Unleashed-GGUF

קוד פתוח

outsourc-eapache-2.02026-08-20

  • gguf
  • uncensored
  • abliterated
  • qwen3.8
  • imatrix

גרסה מכווצת ונטולת צנזורה של מודל 27B, שדוחסת הקשר של 250 אלף טוקנים לכרטיס מסך בודד. היא משתמשת בכיול דינמי לפי שכבות כדי לשמור על דיוק גבוה בנפח קטן.

  • 115 GBמשקל הקבצים
  • 85,687הורדות בחודש
  • 160לייקים

מה זה

מדובר בהמרה בפורמט GGUF של מודל Qwen3.8-27B שעבר הסרת מגבלות תוכן, תוך שימוש בשיטת כימוס דינמית של Unsloth שמתאימה דיוק שונה לכל טנסור בנפרד. במקום לחתוך את כל המשקלים באותה רמה גסה, טנסורים רגישים נשארים בדיוק גבוה יותר, מה שמאפשר לגרסת 3 ביט לעקוף בביצועים גרסאות 4 ביט אחידות ששוקלות יותר ממנה.

בבדיקות MMLU המודל בגרסת Q3 השיג 82.98 אחוזים, ירידה של כ־2.3 נקודות בלבד ממודל המקור הלא מכווץ, ובמקביל החזיר תוצאות שליפה מדויקות מקצה חלון הקשר באורך 250,806 טוקנים. הארכיטקטורה שלו היברידית, עם 17 שכבות תשומת לב מלאה מתוך 65, מה ששומר על צריכת זיכרון נמוכה מאוד לטובת זיכרון ההקשר גם בעומק מלא.

מתאים ל

  • שליפת מידע ממסמכים כבדים

    חלון עבודה של מעל 250 אלף טוקנים נכנס במלואו לכרטיס ביתי ומאתר נתונים בדיוק מלא.

  • סוכן מקומי ללא סירובים

    הסרת מגבלות התוכן מאפשרת טיפול בנושאי אבטחת מידע וטקסט רגיש בלי עצירות יזומות.

  • ניתוח תמונות עם מודל ראייה

    שימוש בקובץ המקרן הנלווה מוסיף עיבוד תמונה וזיהוי מרחבי בתוספת של פחות מגיגה זיכרון.

איפה זה נופל

גרסת הקיצון UD-IQ1_M נכשלת לחלוטין ומתפקדת ברמת ניחוש אקראי של 25.83 אחוזים במבחני ידע, כך שאסור להשתמש בה כלל. בנוסף, הסרת הצנזורה אינה מבטיחה היעדר סירובים מוחלט בכל ניסוח קצה, והבדיקות שנעשו התבססו על מדגם של 20 פרומפטים בלבד ועל שליפת מחרוזת פשוטה ולא על הסקת מסקנות מורכבת בהקשר ארוך.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מצהיר על תמיכה רשמית באנגלית ובסינית בלבד. הוא עשוי לקלוט עברית בזכות נתוני האימון הכלליים של סדרת Qwen, אך אין בדיקות איכות או התחייבות לביצועים תקינים בשפה זו.

מדוע המהירות נמוכה בשיחות עם פלט קצר?

בכל פנייה יש עלות עיבוד קבועה של הרצת המודל וחימום מנגנון החיזוי, שנפרסת טוב יותר כשהתשובה ארוכה. בבקשות קצרות של פחות מ־50 טוקנים הקצב עומד על כ־25 לשנייה, לעומת מעל 50 בטקסט ארוך.

איזו גרסת קובץ כדאי להוריד לכרטיס 24GB?

הגרסה המאוזנת ביותר היא UD-Q3_K_XL בנפח 13.2GB. בדיקות המדדים מראות שגרסאות 4 ביט ומעלה כבדות ואיטיות יותר בלי לתת יתרון ביכולות, וגרסת 1 ביט פגומה לחלוטין.

איך מריצים

כרטיס מסך בודד של 24GB, דוגמת RTX 4090, מספיק כדי להריץ את גרסת UD-Q3_K_XL המומלצת ששוקלת 13.2GB יחד עם מלוא חלון ההקשר, בתנאי שמגדירים זיכרון מטמון מסוג q4_0 לערכי KV. למי שמחזיק כרטיסי 12GB או 16GB, גרסאות כמו UD-IQ2_S ירוצו אך במחיר של ירידה מורגשת ביכולות, בעוד שגרסאות מעל Q3 מוסיפות נפח בלי שיפור אמיתי במדדי המשימות.

הרצה מקומית בשרת llama.cpp עם מודל טיוטה חיצוני מסוג DFlash2 מספקת בין 25 טוקנים לשנייה במענה קצר ועד מעל 50 בפלט ארוך. אם היישום שלכם דורש רק קריאות כלים קצרות מאוד בעומס גבוה, העלות הראשונית לכל בקשה הופכת שירות ענן מנוהל לחלופה הגיונית יותר מבחינת זמני תגובה.

ollama run hf.co/outsourc-e/Qwen3.8-27B-Unleashed-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון Apache 2.0 מתיר שימוש מסחרי חופשי, שינוי הקוד והפצה של המשקלים במוצר פנימי או חיצוני. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והצהרת הרישיון המקורית של הפרויקטים שעליהם הוא מבוסס.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗