GPT
Q

Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF

קוד פתוח

Jackrongapache-2.02026-03-18

  • gguf
  • qwen3_5
  • unsloth
  • qwen
  • qwen3.5

גרסת GGUF של Qwen3.5 שעברה זיקוק מול דוגמאות חשיבה של קלוד. המטרה שלה היא לפתור בעיות מורכבות בפחות טוקנים ובלי מריחות מיותרות.

  • 262,144טוקנים בהקשר
  • 21.0 GBמשקל הקבצים
  • 25,822הורדות בחודש
  • 395לייקים

מה זה

המודל מבוסס על Qwen3.5 בנפח 9B, ואומן בשיטת SFT עם LoRA על 14,000 דוגמאות חשיבה שמחקות את סגנון ההסקה של Claude 4.6 Opus. הנתונים הגיעו משלושה מאגרי זיקוק ציבוריים שהתמקדו במתמטיקה, חידות היגיון וידע כללי, ולא באימון ייעודי לכתיבת קוד.

במבחני HumanEval ו־HumanEval+, היוצר מדווח על שיפור בדיוק לצד ירידה של יותר מ־20% בכמות התווים והטוקנים שנוצרים בזמן החשיבה הפנימית. ההבדל המרכזי מול מודלים אחרים בגודל הזה הוא הניסיון לקצר את שרשרת ההסקה, במקום לתת למודל לרוץ בלולאות חשיבה ארוכות גם בשאלות פשוטות יחסית.

מתאים ל

  • סוכני אוטונומיה מקומיים

    צמצום של 20% בטוקני החשיבה חוסך זמן יקר בלולאות ריצה מרובות של סוכנים מקומיים.

  • פתרון בעיות היגיון וחידות

    הזיקוק התמקד ישירות במתמטיקה והסקה שיטתית, מה שמסייע בפירוק בעיות מובנה.

  • מחקר והשוואת טכניקות זיקוק

    היוצר שיתף מחברות אימון ומדריכים שמתאימים לבדיקה של העברת דפוסי חשיבה במודלים פתוחים.

איפה זה נופל

היוצר מציין במפורש שהיכולות הכלליות הרחבות נפגעו בגלל גודל המדגם המצומצם של 14,000 דוגמאות בלבד. המודל עלול להזות עובדות חיצוניות ואירועים אמיתיים מחוץ לעולם הלוגי הטהור. בנוסף, הכרטיס מציין שהגרסה מיועדת ללמידה, הדגמה ומחקר אקדמי בלבד, ולא נבדקה על משימות ייצור אמיתיות. רשימת השפות הרשמית כוללת אנגלית, סינית וקוריאנית, כך שאין שום הבטחה לתמיכה בעברית.

אותה משפחה

Qwen3.5-9B-Claude-4.6-Opus-Reasoning יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפיתוח תוכנה מלא?

האימון לא כלל נתוני קוד ייעודיים אלא נתוני היגיון כלליים, אם כי נרשם שיפור במבחני HumanEval. למשימות פיתוח מורכבות עדיף לבדוק מודל שאומן ישירות על שפות תכנות.

האם אפשר להריץ אותו על מחשב נייד רגיל?

במשקל קבצים של 21.0GB, מחשב ללא כרטיס מסך ייעודי של 24GB או זיכרון RAM נרחב יתקשה מאוד לייצר קצב טוקנים שימושי.

איך מריצים

המשקל הכולל של הקבצים עומד על 21.0GB בפורמט GGUF, כך שבדיוק המקורי של bfloat16 תצטרכו לפחות 24GB זיכרון וידאו בכרטיס מסך כדי להעלות אותו במלואו, או מעבד חזק עם מספיק זיכרון מערכת להרצה מקומית. חלון ההקשר המדווח מגיע עד 262,144 טוקנים, אבל ניצול של חלון כזה מקפיץ את צריכת ה־RAM באופן משמעותי.

אם אתם צריכים רק מענה מזדמן ולא בונים תשתית עצמאית לעבודה מקומית, עדיף להשתמש ב־API קיים של מודל מסחרי. החומרה הדרושה להרצה רציפה של המודל הזה הופכת לכדאית בעיקר למי שרוצה הרצה מקומית בלי תלות ברשת.

ollama run hf.co/Jackrong/Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

7 קבצים במאגר, 21.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית ללא תשלום תמלוגים. עם זאת, היוצר הוסיף בכרטיס הסתייגות לפיה המודל מיועד למחקר אקדמי ולמידה בלבד, פער שדורש בדיקה משפטית לפני שילוב שלו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗