GPT
Q

qwen3.5-4B-super-coder

קוד פתוח

jica98רישיון לא דווח2026-06-13

  • safetensors
  • gguf
  • qwen3_5
  • coding
  • tool-calling

המודל מציע יכולות תכנות, הפעלת כלים ומצב חשיבה בקובץ קטן שמתאים למכשירים חלשים. הוא נוצר באמצעות זיקוק מודלי קלוד לתוך בסיס קוון חסכוני במיוחד בזיכרון.

  • 262,144טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 34,167הורדות בחודש
  • 92לייקים

מה זה

הבסיס כאן הוא שילוב של שכבות גייטד דלתא-נט ותשומת לב מלאה, כך שרק רבע מהשכבות שומרות מטמון מלא. התוצאה היא תפיסת זיכרון של כ־0.4 גיגה-בייט בלבד עבור הקשר של 32 אלף טוקנים, מה שמאפשר להריץ קוד עם חלון גדול על חומרה צנועה.

היוצר העביר אותו תהליך אימון של חמישה שלבים. זה התחיל מזיקוק של 140 אלף דוגמאות מקלוד סונט ואופוס 4.6 כדי לחקות סגנון וכתיבת בלוקי חשיבה, המשיך באימוני קוד וקריאות לכלים עם התאמת סכמות ג'ייסון, והסתיים בכוונון על עקבות סוכנים של פייבל 5.

על הנייר זה נשמע מרשים, אבל מבחני הביצועים של גרסת הקוונטיזציה שנבדקה מראים תמונה קשה. במבחני התכנות HumanEval פלוס ו־MBPP פלוס התוצאה שנמדדה היא אפס עגול, ושיעור התקינות של מבני ג'ייסון עומד על 40 אחוז בלבד. המפרסם עצמו מציין שייתכן שהדחיסה פגעה ביכולות בצורה דרסטית, כך שלא כדאי לבנות על ביצועים אמינים בלי לבדוק לעומק.

מתאים ל

  • ניסויי הרצה מקומית בטלפון

    ניצול תפיסת הזיכרון הנמוכה כדי לבדוק איך מודל עם מצב חשיבה מתנהג על מכשיר קצה עם 8 גיגה זיכרון.

  • מחקר על זיקוק סוכנים

    בדיקת ההשפעה של עקבות אימון מבוססי קלוד ופייבל על מודלים קטנים, ישירות מתוך משקלי הרשת.

  • בדיקת מבנה בלוקי מחשבה

    בחינת האופן שבו המודל פותח תגיות חשיבה ומפרט שלבי עבודה לפני שהוא ניגש לכתוב את הפלט עצמו.

איפה זה נופל

החולשה המרכזית צועקת מתוך דוח הביצועים הרשמי. ציון של אפס במבחני יצירת קוד סטנדרטיים מראה שהגרסה הדחוסה מתקשה לייצר פתרונות תקינים. בנוסף, תקינות הג'ייסון נכשלה ברוב המקרים עם 40 אחוזי הצלחה בלבד, מה שהופך שימוש בכלים לאוטומציה לרולטה מסוכנת. מודלים אחרים בגודל דומה אמנם מוגבלים, אבל כאן יש פער חריג בין שלבי האימון המורכבים לבין התוצאה שנמדדה בפועל.

שאלות
נפוצות

האם המודל מתאים לפיתוח תוכנה בצוות?

ממש לא. התוצאות במבחני הקוד הרשמיים עומדות על אפס, ודיוק הפלט המבני נמוך מאוד. כתיבת קוד אמיתי לפרודקשן מחייבת אמינות שהמודל הזה פשוט לא מספק כרגע.

למה נתוני הזיכרון שלו כל כך נמוכים בהקשרים ארוכים?

הארכיטקטורה משלבת שכבות דלתא-נט יחד עם שכבות תשומת לב, כך שרק חלק קטן מהשכבות דורש שמירה מלאה של נתוני העבר. זה חוסך המון מקום בזיכרון הראשי גם כשמעמיסים עליו טקסט ארוך.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.2 גיגה-בייט בפורמט בי-פלואוט 16, והגרסה הדחוסה תופסת כ־2.6 גיגה-בייט. זה אומר שאפשר להריץ אותו ישירות על מחשבים ניידים פשוטים, מכשירי אייפון 15 פרו, אייפדים או טלפונים תומכים עם 8 גיגה-בייט זיכרון ומעלה.

בהרצה מקומית בתוכנות מבוססות למה סי-פי-פי מומלץ להפעיל פלאש אטנשן, להגדיר טמפרטורה של 0.6 וטופ-פי של 0.95. אם אתם צריכים קוד שעובד במכה ראשונה בלי הפתעות, עדיף בהרבה לפנות לממשק חיצוני של מודל גדול ומבוסס, כי המודל הזה כרגע מתאים בעיקר לבדיקות ולניסויי קצה.

ollama run hf.co/jica98/qwen3.5-4B-super-coder:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון משמעו שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או להטמיע אותו במוצר מסחרי, מה שחושף חברות לסיכון של הפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗