GPT
Q

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF

קוד פתוח

Jackrongapache-2.02026-03-19

  • transformers
  • gguf
  • qwen3_5
  • image-text-to-text
  • llama.cpp

זיקוק תהליכי חשיבה מקלוד אל מודל מקומי שחותך כרבע מאורך החשיבה המיותר. שומר על 96.91 אחוזים בבנצ'מרק הקוד המקורי ומחזיר תשובות מהר יותר.

  • 262,144טוקנים בהקשר
  • 81.4 GBמשקל הקבצים
  • 18,179הורדות בחודש
  • 618לייקים

מה זה

הפרויקט הזה לוקח את הבסיס של Qwen3.5 בגודל 27B ומאמן אותו על 14,000 דוגמאות חשיבה שנלקחו מקלוד 4.6 אופוס. המטרה כאן היא לא לגרום למודל להסביר כל דבר בפרטי פרטים עד אינסוף, אלא להרגיל אותו לתבנית עבודה מובנית וחסכונית. הוא מפרק בעיות לשלבים ברורים וחוסך התברברות פנימית בפתרון שאלות פשוטות.

בבדיקות מול HumanEval הוא שמר על דיוק זהה למודל הבסיס עם 96.91 אחוזים, אבל קיצר את שרשרת החשיבה בכעשרים וארבעה אחוזים. המשמעות בפועל היא תוספת של 31.6 אחוזים בפתרונות נכונים לכל טוקן שנפלט. האימון התמקד בלוגיקה כללית, מתמטיקה ושאלות מילוליות ולא בקוד ייעודי, ולכן ההצלחה במשימות תכנות מעידה על שלד הסקת מסקנות שהועתק בצורה יעילה.

מתאים ל

  • פתרון בעיות מתמטיקה ולוגיקה

    אימון על תבניות חשיבה מובנות מאפשר לו לפרק בעיות מילוליות וחישובים בצורה שיטתית בלי לבזבז טוקנים על מלל ריק.

  • ניתוח קוד וכתיבת פונקציות

    ציון של 96.91 אחוזים ב־HumanEval מוכיח יכולת טובה בכתיבת קוד עצמאית ובפתרון באגים מקומיים.

  • מחקר על יעילות הסקת מסקנות

    מתאים למי שבוחן זיקוק מודלים מקומיים ורוצה לנתח קיצור של שרשראות חשיבה ללא פגיעה ביציבות.

איפה זה נופל

החיסכון באורך החשיבה גובה מחיר ישיר בידע כללי ובהבנה מורכבת. המודל איבד 7.2 אחוזים במבחן MMLU-Pro לעומת מודל הבסיס, וירד ב־1.24 אחוזים במבחן HumanEval Plus. הכרטיס מציין במפורש ביצועים נמוכים יותר בהבנת הקשרים ארוכים ובמשימות מרובות שלבים.

בנוסף, רשימת השפות הרשמית כוללת רק אנגלית, סינית וקוריאנית, כך שעברית לא נתמכת כאן באופן מובנה ועלולה להוביל להזיות. היוצר מצהיר שמדובר בגרסת ניסוי שנועדה למחקר והדגמה בלבד, עם נטייה להזיות בעובדות מציאותיות במהלך שלבי החשיבה.

אותה משפחה

Qwen3.5-27B-Claude-4.6-Opus-Reasoning יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו עבור מערכות שירות לקוחות בעברית?

לא. המודל אומן ותועד עבור אנגלית, סינית וקוריאנית בלבד, ואינו כולל התאמה לעברית. בנוסף, מנגנון החשיבה הפנימי שלו עלול להכניס הזיות ועיכובים שאינם מתאימים לשיחה ישירה מול משתמש קצה.

למה שהמודל יאבד נקודות בידע כללי אם הוא חושב טוב יותר?

האימון התמקד בקיצור שרשראות החשיבה ובהסרת ניתוח יתר. התהליך הזה ייעל את המענה לשאלות מוגדרות, אך גרם לפגיעה של 7.2 אחוזים במבחן MMLU-Pro עקב צמצום מרחב ההיסק הכללי של מודל הבסיס.

איך מריצים

המשקל המלא של הקבצים מגיע ל־81.4 גיגה בייט ומחולק לשמונה קבצים בדיוק bfloat16. כדי להריץ אותו בהגדרות המקוריות תצטרכו כרטיסי מסך מקצועיים עם לפחות 60 עד 80 גיגה בייט זיכרון גרפי פנוי, או שרת ייעודי שמריץ מנוע כמו vLLM בשילוב Unsloth.

אם אין לכם חומרה כזאת במשרד או בתקציב הענן, אין טעם להסתבך עם פריסה עצמית. במצב כזה עדיף לפנות ישירות ל־API של מודל מסחרי גדול או לחכות לקוונטיזציה קלה יותר שתוכל לרוץ על כרטיס בודד.

ollama run hf.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח ברמת המאגר הוא apache-2.0, שמאפשר בדרך כלל שימוש חופשי, שינוי קוד ושילוב במוצרים מסחריים. עם זאת, היוצר כתב בטקסט שהמודל מיועד למחקר אקדמי ולהדגמה בלבד, ובנוסף הוא אומן על פלטים שזוקקו ממודל קלוד. שילוב שלו במוצר מסחרי עלול ליצור בעיה משפטית מול תנאי השימוש של מקור המידע.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗