GPT
Q

Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled

קוד פתוח

lordx64apache-2.02026-04-18

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • text-generation

זיקוק תהליכי חשיבה של קלוד אופוס לתוך מודל תערובת מומחים פתוח. הוא פותר בעיות מורכבות תוך הצגת שלבי המחשבה, עם עלות הרצה בפועל של מודל קטן בהרבה.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 67.0 GBמשקל הקבצים
  • 932הורדות בחודש

מה זה

המודל מתבסס על ארכיטקטורת תערובת מומחים של שלושים וחמישה מיליארד פרמטרים, אבל מפעיל בפועל רק כשלושה מיליארד פרמטרים בכל טוקן. האימון לקח כשמונה אלפים שיחות שנוצרו על ידי קלוד אופוס 4.7, ולימד את הבסיס לייצר בלוקי חשיבה מפורטים לפני שהוא ניגש לתשובה הסופית. השילוב הזה נותן התנהגות שמזכירה מודל קנייני כבד, אך על תשתית שרצה בקצב של מודל קל.

במדדי ביצועים הוא מציג שמונים וארבעה אחוזים במתמטיקה של גי אס אם שמונה קיי, וקרוב לשבעים וחמישה אחוזים באמ אמ אל יו פרו. הציונים הגבוהים מגיעים בעיקר ממקצועות מדעיים כמו ביולוגיה, מתמטיקה ופיזיקה, שבהם פירוק הבעיה לשלבים משפר ישירות את התוצאה. לעומת זאת, במבחנים שדורשים ידע מבוסס עובדות כמו הנדסה ומשפטים, התוצאות צונחות לאזור החמישים וחמישה אחוזים בלבד.

מתאים ל

  • פתרון בעיות מתמטיקה

    מפרק בעיות רב שלביות לחישובים מפורטים בתוך שרשרת החשיבה לפני הפקת התוצאה.

  • ניתוח ובדיקת קוד

    עובר שלב אחרי שלב על הלוגיקה כדי לאתר מקרי קצה ותקלות תכנות מורכבות.

  • תכנון משימות לסוכנים

    מייצר תוכניות פעולה מפורטות ומנומקות למהלכים מרובי שלבים במערכות עצמאיות.

איפה זה נופל

האימון היה מסוג לורה לשכבות הקשב בלבד, מבלי לגעת ברשתות המומחים של מודל הבסיס. זה אומר שהמודל קיבל סגנון חשיבה ולא ידע חדש. אם מודל המקור של קוון לא הכיר עובדה מסוימת, הגרסה הזו לא תתקן את זה ותמשיך לטעות באותו מקום.

בעיה נוספת היא אורך הפלט. בשאלות קשות הוא פולט בין חמשת אלפים לשלושים אלף טוקנים רק בתוך שלבי המחשבה, מה שיוצר זמני תגובה ארוכים במיוחד ותוקע מערכות שמצפות לתשובה מיידית. בנוסף, במבחנים מסוימים הוא לא החזיר תשובות בפורמט מוגדר היטב, דבר שעלול לדרוש ניקוי ידני של הטקסט לפני שמציגים אותו למשתמש.

שאלות
נפוצות

האם אפשר לקבל רק את התשובה בלי כל שלבי החשיבה?

כן, אפשר לחתוך את הבלוק של שלבי המחשבה בעזרת עיבוד טקסט פשוט בצד השרת לפני שמציגים את הפלט. אפשרות נוספת היא להגביל את מספר הטוקנים המקסימלי, אבל הגבלה נמוכה מדי עלולה לעצור אותו באמצע החישוב ולפגוע באיכות התשובה.

כמה זיכרון כרטיס מסך נדרש בשביל להריץ אותו במחשב מקומי?

הגרסה המכומצת הקלה ביותר דורשת כעשרים גיגה של זיכרון מסך, כך שהיא נכנסת בכרטיס ביתי חזק. לגרסאות איכותיות יותר תצטרכו לפחות שלושים ושניים עד ארבעים גיגה, במיוחד כשלוקחים בחשבון את המקום שדורש חלון ההקשר הארוך בזמן עיבוד.

איך מריצים

כדי להריץ אותו בדיוק מלא צריך כרטיס שרת בודד של שמונים גיגה, כמו איי מאה או אייץ׳ מאה, מומלץ דרך וי אל אל אם שמתמודד טוב עם ניתוב המומחים וניהול הזיכרון. אם המטרה היא עבודה מקומית, יש גרסאות מכומצות בפורמט ג׳י ג׳י יו אף שנעות בין תשעה עשר גיגה בגרסה המכווצת ביותר ועד שלושים וחמישה גיגה לגרסה הכמעט מלאה.

אם אין לכם כרטיס כזה זמין או שאתם לא צריכים שרשרת חשיבה מקומית ומבודדת, עדיף להמשיך להשתמש ישירות בשרתי ענן. הפעלת מודל שכותב עשרות אלפי טוקנים של חשיבה מייצרת עומס חישובי כבד, ולא משתלמת עבור שאלות קצרות או תשובות מהירות.

from transformers import pipeline

pipe = pipeline("text-generation", model="lordx64/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ׳י שתיים, שמאפשר שימוש חופשי, שינוי קוד ושילוב במוצרים מסחריים ללא תשלום תמלוגים. יחד עם זאת, דאטה האימון מבוסס על פלטים שנלקחו מהממשק של אנתרופיק, ולכן שימוש מסחרי מחייב בדיקה של תנאי השימוש מול החברה כדי לוודא שאין התנגשות משפטית סביב זיקוק המודל שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗