GPT
Q

Qwen3.5-9b-Sushi-Coder-RL-GGUF

קוד פתוח

bigatunaapache-2.02026-03-27

  • gguf
  • llama.cpp
  • qwen3_5
  • code
  • rl

גרסת GGUF מכווננת לכתיבת קוד על בסיס Qwen 3.5, שעברה אימון חיזוקים ממוקד. היא מיועדת למי שרוצה להריץ מודל תכנות מקומי ויעיל על חומרה צנועה יחסית.

  • 21.8 GBמשקל הקבצים
  • 4,552הורדות בחודש
  • 97לייקים

מה זה

הבסיס כאן הוא מודל בגודל 9 מיליארד פרמטרים שעבר שני שלבים עיקריים. תחילה אימון כוונון עדין על דאטה־סטים של חשיבה ופתרון בעיות מ־Codeforces, ולאחר מכן אימון למידת חיזוק לתכנות באמצעות סוכן ייעודי. המודל שומר על יכולות מולטימודליות, מה שאומר שהוא מסוגל לקבל גם קלט תמונה לצד טקסט באמצעות קובץ הקרנה ייעודי.

במבחן LiveCodeBench שבודק יצירת קוד מעשי, המודל עקף את מודל הבסיס בהפרש ניכר. בריצה דטרמיניסטית הוא פתר 54 מתוך 268 בעיות לעומת 9 בלבד של מודל הבסיס, ובדגימה עם טמפרטורה הגיע ל־64 פתרונות. זה מראה שהכוונון הממוקד לקוד אכן עשה עבודה משמעותית ביחס למודל הגולמי, גם אם עדיין מדובר בפתרון של פחות מרבע מהמשימות במבחן הקשה הזה.

מתאים ל

  • עוזר קוד מקומי ב־IDE

    מאפשר להשלים פונקציות ולפתור באגים מקומית ב־VS Code בלי לשלוח שורות קוד קנייניות לשרתים חיצוניים.

  • ניתוח צילומי מסך של שגיאות

    בזכות קובץ הפרויקטור המולטימודלי, אפשר להזין לו תמונות של ארורים ישירות מהטרמינל כדי לקבל כיוון לפתרון.

  • אוטומציה בסביבות מבודדות

    מתאים לשרתי CI פנימיים או סביבות פיתוח ללא גישה לאינטרנט שצריכות יצירת סקריפטים בסיסיים באנגלית.

איפה זה נופל

למרות השיפור הניכר על פני מודל הבסיס, אחוזי המעבר שלו במבחן עומדים על כ־20 עד 24 אחוזים בלבד, כלומר הוא נכשל ברוב בעיות הקוד המורכבות. המודל מוגדר רשמית לשפה האנגלית בלבד, כך שלא כדאי לבנות עליו לפקודות בעברית או לתיעוד מקומי. בנוסף, חלון ההקשר שנבדק בהרצות המבחן היה קצר ועמד על 4,096 טוקנים, מגבלה משמעותית אם אתם מתכננים להזין לו קובצי קוד ארוכים.

שאלות
נפוצות

האם חייבים להוריד גם את קובץ ה־BF16-mmproj?

אם אתם מתכננים להשתמש במודל רק לקוד טקסטואלי, קובץ ה־GGUF הרגיל יספיק. קובץ ה־mmproj נחוץ רק אם אתם רוצים להזין לו תמונות, כמו צילומי מסך של ממשקים או הודעות שגיאה.

באיזה כימות כדאי לבחור להרצה ביתית?

לרוב המחשבים מומלץ לבחור בגרסת Q4_K_M, שמציעה יחס מצוין בין שימוש בזיכרון למהירות ריצה. גרסת Q8_0 תתן דיוק מעט גבוה יותר אך תדרוש כמעט כפול זיכרון.

האם הוא מסוגל לעבוד עם עברית?

המודל מוגדר לשפה האנגלית בלבד. מודלים מסדרת Qwen בדרך כלל מבינים מעט עברית, אך המודל הזה כוונן ספציפית לקוד באנגלית ולא כדאי להסתמך עליו בהבנת הנחיות בעברית.

איך מריצים

כדי להריץ אותו צריך להוריד את אחד מקובצי הטקסט המכומתים, Q4_K_M לחסכון בזיכרון או Q8_0 לדיוק גבוה יותר, ויחד איתו את קובץ ה־BF16-mmproj כדי לשמור על היכולת המולטימודלית. מודל מכומת של 9 מיליארד פרמטרים ב־Q4 נכנס בנוחות לכרטיס מסך ביתי עם 8 עד 12 גיגה זיכרון, או רץ על מעבד מודרני בעזרת llama.cpp.

אם אתם צריכים רק לכתוב סקריפטים פשוטים מדי פעם מקומית בלי תלות ברשת, הרצה כזו הגיונית מאוד. מצד שני, אם נדרש הקשר עבודה ענק או דיוק מוחלט במערכות ייצור, עדיף להשתמש ב־API חיצוני של מודל ענק שמציע ביצועים חזקים פי כמה בלי לתחזק שרת מקומי.

ollama run hf.co/bigatuna/Qwen3.5-9b-Sushi-Coder-RL-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה מחדש במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים ועותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗