GPT
Q

Qwen3.8-27B-GGUF

קוד פתוח

unslothapache-2.02026-08-13

  • gguf
  • qwen3_5
  • unsloth
  • endpoints_compatible
  • imatrix

גרסת קוונטיזציה של מודל רב מודלי במשקל 27 מיליארד פרמטרים. הוא מביא יכולות ראייה, תמיכה בקריאות כלים וחשיבה מובנית לגודל שמתאים לתחנות עבודה מקומיות.

  • 262,144טוקנים בהקשר
  • 440 GBמשקל הקבצים
  • 10,675,683הורדות בחודש
  • 3,797לייקים

מה זה

המודל מבוסס על ארכיטקטורת Qwen3.5 ומשלב עיבוד טקסט יחד עם מודול ראייה מובנה לתמונות ולווידאו של שעות. החידוש המרכזי בעיבוד הוא שילוב שכבות Gated DeltaNet לצד שכבות תשומת לב, יחד עם אימון בחיזוי רב טוקנים. השיטה הזו מאפשרת טיפול בהקשר של 262,144 טוקנים ישירות, עם אפשרות הרחבה למיליון טוקנים באמצעות RoPE.

חבילת הקבצים הזו מגיעה מבית Unsloth וכוללת קוונטיזציה בשיטת Dynamic V3.0. לפי נתוני היצרן, השיטה מציגה דיוק גבוה ביותר מ־10% בקרב ה־top 1% בהשוואה לספקי GGUF מתחרים באותו גודל קובץ. מעבר למספרים, היתרון בשטח מתבטא ביציבות של ניתוח מבני JSON מקוננים עבור סוכנים אוטונומיים וכלים חיצוניים.

מתאים ל

  • סוכני פיתוח תוכנה

    תמיכה בתפקיד מפתח ופענוח JSON מקונן הופכים אותו למתאים להרצת פקודות ותיקון קוד בסביבות כמו Codex.

  • ניתוח מסמכים טכניים ותרשימים

    מודול הראייה המובנה מפענח דיאגרמות STEM וטקסטים מורכבים ישירות מתוך קבצים גרפיים ללא צורך במודל OCR נפרד.

  • תחקור הקלטות וידאו ארוכות

    חלון הקשר של 262 אלף טוקנים מאפשר העלאת סרטונים שלמים ומענה על שאלות לגבי אירועים ספציפיים שהתרחשו בהם.

איפה זה נופל

מצב החשיבה דלוק כברירת מחדל, מה שמייצר תגובות ארוכות וצריכת משאבים כבדה אם לא מכבים אותו ידנית. בהנחיות השימוש מצוין ששינוי ערך presence penalty מעבר לרמה הבסיסית עלול לגרום לערבוב שפות ולירידה באיכות הפלט. בנוסף, עיבוד וידאו באורך שעות דורש שינוי ידני של הגדרות גודל הדגימה בקובץ התצורה ל־469,762,048 כדי לקבל דיוק סביר, אחרת הוא מדלג על פרטים חיוניים.

אותה משפחה

Qwen3.8 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים להוריד את כל 440 הגיגה בייט כדי לעבוד איתו?

לא. המאגר מכיל גרסאות שונות של רמות דחיסה. אתם בוחרים ומורידים רק את קובץ ה־GGUF שמתאים לגודל הזיכרון שיש לכם במחשב.

איך שולטים על עומק ההסברים והחשיבה של המודל?

אפשר לכבות את מצב החשיבה לגמרי בכל קריאה בנפרד. בנוסף, המודל מאפשר כוונון של עומק הניתוח בעזרת הפרמטר reasoning_effort ושמירת שרשרת המחשבה לאורך השיחה בעזרת preserve_thinking.

איך מריצים

משקל כלל הקבצים במאגר מגיע ל־440 גיגה בייט המחולקים ל־33 קבצים, אבל מורידים רק את קובץ ה־GGUF ברמת הקוונטיזציה הרצויה. להרצה מקומית של דגם 4 ביט תצטרכו מחשב עם 16 עד 24 גיגה בייט זיכרון גרפי או מערכת Mac עם זיכרון מאוחד דומה, במיוחד אם רוצים לנצל את חלון ההקשר הארוך. אפשר להריץ אותו דרך Unsloth Desktop שתומך ישירות במתג החשיבה של המודל.

אם אתם מתכננים לנתח סרטוני וידאו ארוכים ברזולוציה גבוהה או צריכים להעמיס מאות אלפי טוקנים במקביל, כרטיס בודד יתקשה לעמוד בעומס הזיכרון. במקרים כאלה עדיף לפנות לשרת ייעודי בענן או ל־API מרוחק.

ollama run hf.co/unsloth/Qwen3.8-27B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו מחדש בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, ללא אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗