GPT
Q

Qwen3.5-27B-GGUF

קוד פתוח

unslothapache-2.02026-02-24

  • gguf
  • unsloth
  • image-text-to-text
  • endpoints_compatible
  • imatrix

מודל מולטימודלי פתוח שמביא ביצועים של מודלים ענקיים לגודל שניתן לדחוס לשרת בודד. הוא מתאים למי שצריך ראייה ממוחשבת, קידוד מורכב והקשר עצום בלי לשלם על API חיצוני.

  • 395 GBמשקל הקבצים
  • 477,576הורדות בחודש
  • 503לייקים

מה זה

מדובר בגרסת GGUF שעברה אופטימיזציה על ידי Unsloth למודל הבסיס של עליבאבא. הוא משלב עיבוד תמונה וטקסט יחד כבר משלבי האימון הראשונים, ובנוי על ארכיטקטורה היברידית של Gated Delta Networks לצד שכבות תשומת לב מסורתיות. המבנה הזה נועד לייצר מהירות תגובה גבוהה במיוחד בהסקה, תוך שמירה על חלון הקשר טבעי של 262,144 טוקנים שניתן להרחבה מעבר למיליון.

במדדי השפה והחשיבה הוא עוקף מודלים פתוחים גדולים ממנו בהרבה, כמו גרסאות 120B ואפילו 235B מהדורות הקודמים. בבדיקת SWE-bench Verified שמודדת פתרון בעיות קוד אמיתיות ממאגרי תוכנה, הוא הגיע לציון של 72.4, תוצאה שמקבילה ישירות למודלים מובילים של חברות מסחריות סגורות, ובבדיקת עמידה בהוראות מורכבות של IFEval הוא מגרד 95 נקודות.

המשמעות של הנתונים האלה היא לא רק מספר יפה על נייר, אלא יכולת אמיתית לשמש כסוכן אוטונומי שמפעיל כלים ורץ על קוד מורכב. הוא לא מסתפק בהשלמת שורות פשוטה, אלא מחזיק תוכניות עבודה שלמות בלי לאבד את חוט המחשבה באמצע תהליכים מרובי שלבים.

מתאים ל

  • סוכן תכנות מקומי

    הוא מגיע לציון 72.4 בפתרון באגים מורכבים במאגרים, ומסוגל להריץ פקודות בסביבת פיתוח בלי שרת חיצוני.

  • ניתוח מסמכים חזותיים

    מבנה מולטימודלי מובנה מאפשר לו לקרוא צילומי מסך, תרשימים וטבלאות יחד עם הנחיות טקסט ארוכות.

  • עיבוד תעתיקים ארוכים

    חלון הקשר עצום של 262,144 טוקנים מחזיק תיעוד טכני שלם או קבצי לוג ענקיים ללא צורך בחיתוך אגרסיבי.

איפה זה נופל

למרות ההבטחה לחלון הקשר של מעל רבע מיליון טוקנים, בפועל ניהול זיכרון של גודל כזה מקומית דורש משאבים עצומים שרוב המפתחים לא מחזיקים. בנוסף, במבחני תכנות תחרותי כמו CodeForces המודל השיג ציון של 1899, שזה נמוך יותר מגרסאות המומחים הגדולות יותר בסדרה, מה שמעיד על קושי באלגוריתמיקה מורכבת במיוחד שנשענת על מתמטיקה טהורה.

אותה משפחה

Qwen3.5 יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך אפשר להריץ אותו מהר בלי שהוא יתחיל לכתוב מגילות מחשבה?

אפשר לבטל את מנגנון הנימוק הפנימי ישירות דרך הגדרות הפרומפט בעזרת ביטול הדגל הייעודי בטמפלט השיחה. זה מונע ממנו לייצר טוקנים מיותרים של חשיבה ומקצר את זמן התגובה כשצריכים תשובות ישירות וקצרות.

מה ההבדל בין הקבצים השונים ששוקלים יחד 395 גיגה בעמוד?

המאגר מציע מגוון רחב של גרסאות דחיסה שונות ולא קובץ אחד שצריך להוריד במלואו. כל גרסה מאזנת אחרת בין דרישות זיכרון הווידאו של הכרטיס לבין הדיוק, כך שאתם בוחרים רק את הקובץ הספציפי שמתאים לגודל הזיכרון שלכם.

איך מריצים

כדי להריץ קובץ קוונטיזציה של מודל בגודל 27 מיליארד פרמטרים תצטרכו כרטיס גרפי עם לפחות 24 גיגה זיכרון עבור דחיסות בינוניות, או שני כרטיסים כאלה אם אתם מכוונים לדחיסה עדינה או להקשר ארוך. המאגר כולל 29 קבצים במשקל כולל של 395 גיגה שמכילים מגוון גרסאות קוונטיזציה, כולל שימוש בטבלאות imatrix חדשות ובפורמט הדינמי של Unsloth. מי שרוצה לחסוך זיכרון ולמנוע פגיעה בתשובות ממוקדות יכול לכבות את מנגנון החשיבה הפנימי דרך הגדרות הפרומפט.

אם אין לכם חומרה ייעודית מקומית עם זיכרון וידאו מתאים, הניסיון להריץ אותו על מעבד מרכזי בלבד ייקח נצח ויהפוך את השימוש לסיוט. במקרים של עומסים לא קבועים או היעדר שרת זמין, עדיף בהרבה לפנות לנקודת קצה מנוהלת בענן שגובה לפי שימוש במקום לרכוש חומרה כבדה מראש.

ollama run hf.co/unsloth/Qwen3.5-27B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ ברישיון apache-2.0, שהוא רישיון קוד פתוח מתירני מאוד. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פרטיים ולהפיץ אותו מחדש ללא תשלום תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצהירים על שינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗