GPT
Q

Qwen3.5-9B-DeepSeek-V4-Flash-GGUF

קוד פתוח

Jackrongapache-2.02026-04-29

  • transformers
  • gguf
  • text-generation-inference
  • unsloth
  • qwen3_5

זיקוק של יכולות החשיבה מתוך DeepSeek-V4 לתוך מודל בגודל תשעה מיליארד פרמטרים. המטרה היא להשיג פתרון בעיות רב-שלבי והפעלת כלים בלי לשלם בזמני תגובה כבדים.

  • 32.2 GBמשקל הקבצים
  • 422,195הורדות בחודש
  • 314לייקים

מה זה

היוצר לקח את בסיס Qwen3.5-9B ואימן אותו בעזרת Unsloth על דאטה-סט מצומצם של שמונת אלפים דוגמאות מתוך DeepSeek-V4. הרעיון כאן הוא להעביר שרשראות חשיבה מורכבות ממודל ענק למשקל קל, במקום להסתפק בהעתקת סגנון התשובה בלבד. המודל מוגדר למשימות של טקסט ותמונה ומכוון לעבודה עם סוכנים אוטומטיים.

במבחני ביצועים מקומיים שפורסמו בכרטיס בקוונטיזציית Q5_K_M מול דגם הבסיס, ההבדל העיקרי מורגש ביכולת לפרק משימות של הפעלת כלים ותכנון שלבים. התוצאות מראות שהאימון הממוקד אכן הוסיף עומק לוגי, אך יש לזכור שמדובר בבדיקה פנימית מבוקרת ולא במבחן רשמי רחב היקף.

מתאים ל

  • סוכני פעולה מקומיים

    הזיקוק נועד להפעלת כלים מרובת שלבים, מה שמתאים לסוכנים שצריכים לתכנן פעולות בסביבה מבוקרת.

  • פיתוח קוד בסביבה סגורה

    טמפרטורה נמוכה מאפשרת להפיק פתרונות לוגיים למשימות תכנות בלי להוציא קוד מחוץ לרשת המקומית.

  • ניתוח משולב של תמונה וטקסט

    הארכיטקטורה תומכת בקלט ויזואלי ומאפשרת לשלב הסקת מסקנות מתמונות יחד עם פקודות טקסט.

איפה זה נופל

למרות החשיבה המשופרת, המודל מוגבל בידע עובדתי נידח בגלל גודלו הפיזי. הכרטיס מודה בפירוש בבעיית חשיבת יתר, שבה המודל מייצר שרשראות חשיבה ארוכות ומיותרות גם עבור שאלות קלות ופשוטות. נוסף על כך, תהליך הזיקוק פגע בחלק מהגנות הבטיחות והיישור המקוריים, כך שחובה לסנן פלטים לפני שמשלבים אותו במערכת מול לקוחות. המודל גם אינו כולל תמיכה מובנית בעברית לפי רשימת השפות הרשמית.

אותה משפחה

Qwen3.5-9B-DeepSeek-V4-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

השפות הרשמיות שצוינו הן אנגלית, סינית, קוריאנית, יפנית, ספרדית ורוסית. הוא עשוי לפלוט עברית בזכות משקלי הבסיס של Qwen, אך האימון לא יועד לכך והדיוק יהיה נמוך.

למה המודל מגיב לאט על שאלות קצרות?

האימון הטמיע הרגל של שרשראות חשיבה ארוכות שנלקחו מדגם הלימוד. הוא מנתח בעיות פשוטות כאילו היו מורכבות, מה שמבזבז טוקנים ומאריך את זמן ההמתנה לתשובה הסופית.

איך מריצים

הקבצים בפורמט GGUF תופסים יחד 32.2 גיגה-בייט ומחולקים לשמונה חלקים. כדי להריץ גרסה מכווצת כמו Q5_K_M תצטרכו כרטיס מסך עם לפחות שנים-עשר עד שישה-עשר גיגה זיכרון, או עבודה דרך זיכרון המחשב אם מוכנים לסבול איטיות מסוימת. האימון הראשוני בוצע על שרתי DGX, אך המטרה של קבצי GGUF היא הרצה בסביבות מקומיות.

היוצר ממליץ על טמפרטורה בין 0.7 ל־1.0 עם top_p של 0.95, כאשר למשימות קוד עדיף להישאר ברף התחתון. אם המטרה היא להריץ שאילתות מזדמנות בלבד, החזקת חומרה ייעודית כבדה עבור מודל כזה עשויה להיות פחות משתלמת מפנייה ישירה לשרתי ענן חיצוניים.

ollama run hf.co/Jackrong/Qwen3.5-9B-DeepSeek-V4-Flash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש, כולל הטמעה במוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית בקבצים שאתם מחלקים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗