GPT
Q

Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled

קוד פתוח

Jackrongapache-2.02026-03-07

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • text-generation-inference

התאמה של ארכיטקטורת MoE עם זיקוק שרשראות חשיבה מבוססות קלוד. מתאים למי שרוצה חשיבה מובנית בקוד פתוח בלי לולאות מחשבה אינסופיות.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 67.0 GBמשקל הקבצים
  • 345הורדות בחודש

מה זה

המודל מבוסס על Qwen3.5-35B-A3B ועבר כוונון עדין באמצעות LoRA כדי לחקות את דפוסי ההיגיון של Claude-4.6 Opus. האימון התמקד במבנה חשיבה מסודר שמחלק משימות לשלבים מוגדרים בתוך תגיות ייעודיות, במקום שיטת ניסוי וטעייה מפותלת שלעיתים מאפיינת מודלים דומים. התהליך כלל עדכון של 465,551,360 פרמטרים בלבד מתוך סך הפרמטרים, כלומר כ־1.31% מהמודל, תוך הגעה לערך loss של כ־0.384 בסיום.

התוכן אומן על מאגרי נתונים מזוקקים מרוכזים, הכוללים דוגמאות חשיבה ברמת עצימות גבוהה. היתרון המעשי כאן הוא מענה אנליטי ישיר שחוסך טוקנים מיותרים בתהליך ההסקה. אין כאן מבחני ביצועים כמותיים מספריים, כך שההבדל המרכזי מול מודלים אחרים בגודל הזה מתבטא בעיקר בצורת ניתוח הבעיה ובמבנה התשובה הסופי.

מתאים ל

  • פירוק בעיות תכנות מורכבות

    מבנה החשיבה המובנה מחלק את משימת הפיתוח לשלבים לוגיים סדורים לפני כתיבת הקוד.

  • ניתוח נתונים ופתרון חישובים

    מתאים למשימות מתמטיקה וניתוח טקסטואלי לא מקוון שדורשות מעקב שקוף אחר ההיגיון.

  • חקירת תהליכי זיקוק מודלים

    קוד האימון והמדריך הזמינים מאפשרים לבחון שיטות כוונון LoRA על ארכיטקטורות MoE.

איפה זה נופל

היוצר מגדיר את הגרסה הזו כתצוגה מקדימה, מה שאומר שתשתיות ההרצה, התבניות והאינטגרציות עדיין אינן יציבות לחלוטין ועלולות להכיל באגים. המודל עלול לייצר הזיות של עובדות חיצוניות במהלך שלבי החשיבה הפנימיים. הוא תומך רשמית באנגלית, סינית וקוריאנית בלבד, כך שעבור עברית אין התחייבות ליכולת תקינה. לא הייתי משתמש בו במערכות זמן אמת עקב מבנה החשיבה הארוך.

שאלות
נפוצות

האם המודל מתאים לעבודה שוטפת בעברית?

השפות המדווחות בכרטיס המודל הן אנגלית, סינית וקוריאנית בלבד. כל שימוש בעברית יישען על בסיס הידע הכללי של מודל המקור וללא התאמה ייעודית, לכן לא מומלץ להסתמך עליו למשימות בשפה זו.

האם אפשר להריץ אותו על מחשב נייד חזק?

הקבצים שוקלים 67.0 GB בפורמט המקורי, ולכן מחשב אישי רגיל יקרוס מיד מחוסר זיכרון. כדי להפעיל אותו נדרשת חומרה ברמת שרת עם כרטיסי מסך בעלי נפח זיכרון גבוה במיוחד.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־67.0 GB בדיוק bfloat16, מה שאומר שחובה להחזיק כרטיסי מסך חזקים במיוחד רק כדי לטעון אותו לזיכרון. באימון עצמו נדרשו מאיצים עם 80GB VRAM עקב דרישות של 131072 בתים של זיכרון משותף לבלוק CUDA, כך שהרצה מקומית על חומרה צרכנית רגילה אינה מעשית ללא קוונטיזציה כבדה.

אם אין לכם שרת ייעודי זמין עם זיכרון גרפי מתאים, קריאה ישירה לשירות ענן או API תהיה זולה ומהירה בהרבה. המודל מתאים בעיקר למי שחייב לשמור על עיבוד נתונים מבודד לגמרי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Jackrong/Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי קוד והפצה מחדש ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים שתפיצו במוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗