GPT
D

DeepSeek-TNG-R1T2-Chimera

קוד פתוח

tngtechmit2025-07-02

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

שילוב מומחים משלושה מודלים של דיפסיק שמנסה לתת חשיבה מעמיקה בלי לבזבז זמן וטוקנים. הוא מהיר יותר מגרסאות החשיבה המקוריות ומדייק במבחני תכנות ומתמטיקה.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 149הורדות בחודש

מה זה

המודל הזה הוא כימרה שנוצרה בשיטת Assembly of Experts משלושה מודלים שונים: דיפסיק V3 מתאריך 0324, ושתי גרסאות של R1, כולל עדכון 0528. המטרה של החיבור הישיר בין המומחים היא לפתור בעיות עקביות בתגיות החשיבה שהיו בגרסה הקודמת, וליצור מודל שמסוגל לפתור בעיות מורכבות בלי להימרח בפלט ארוך מדי.

במבחני ביצועים הוא עוקף את R1 המקורי ברוב המדדים, כולל ציון של 82.3 ב־AIME-24 לעומת 79.8, ו־64.4 במבחן התכנות Aider Polyglot לעומת 52.0 בלבד של המקור. הוא לא מגיע לשיאים המוחלטים של R1-0528 במתמטיקה כבדה, אבל לפי הבדיקות הוא מייצר פלט במהירות כפולה ממנו, ומציג שיעור הזיות נמוך במיוחד של 5.5 אחוזים במדד וקטרה לעומת 14.3 אחוזים במודל הבסיס.

מתאים ל

  • פתרון בעיות קוד אוטומטי

    התוצאה במבחן Polyglot מראה יעילות גבוהה בניתוח שגיאות וכתיבה ללא צורך בהמתנה ארוכה לטוקנים.

  • ניתוח לוגים טכניים ארוכים

    חלון ההקשר הגדול והבדיקות המוצלחות בעומק של עשרות אלפי טוקנים מאפשרים מעבר על קובצי שגיאות ענקיים.

  • שירותים הדורשים מינימום שגיאות

    שיעור הזיות נמוך מאוד במדידות הופך אותו לאפשרות סבירה יותר עבור שליפת מידע מדויקת.

איפה זה נופל

המודל חלש יותר מחלק מגרסאות הבסיס כשמדובר במשימות קיצון שדורשות הסקת מסקנות מתמשכת, שם R1-0528 עדיין משיג ציונים גבוהים יותר בזכות זמן חשיבה ארוך בהרבה. בנוסף, מי שבונה על הפעלת פונקציות צריך להיזהר. התמיכה ב־Function Calling אינה מובנית במנועי ההסקה הפופולריים ודורשת טלאים בקוד או טעינת מפענח מותאם אישית.

מבחינה רגולטורית באירופה, היוצרים ממליצים לבחון עמידה בדרישות חוק ה־AI האירופי או להפסיק שימוש, מה שעלול להקשות על הטמעה במוצרים המיועדים לשוק הבינלאומי.

שאלות
נפוצות

האם כדאי להחליף את R1 המקורי במודל הזה?

כן, ברוב המקרים הוא משמש תחליף ישיר עדיף. הוא חכם יותר במבחני היגיון ותכנות, פולט פחות הזיות, ומייצר תשובות בקצב מהיר יותר בכעשרים אחוזים.

איך מפעילים פונקציות וכלים חיצוניים עם המודל?

המנועים הקיימים לא מזהים את הפורמט שלו בצורה אוטומטית. ב־vLLM מוכרחים להוסיף דגל שמפנה לקובץ הפייתון המצורף במאגר, וב־SGLang נדרש עדכון ידני של קוד המקור של המערכת כדי שהקריאות יפוענחו כראוי.

איך מריצים

כדי להעלות 641 גיגה-בייט של משקולות בפורמט bfloat16 דרוש שרת של שמונה מאיצי H200 או מאיצי MI325X, עם זיכרון משותף עצום. הרצה מקומית כזו עולה אלפי דולרים בחודש בתשתיות ענן, ולכן לרוב הצוותים אין סיבה אמיתית לאחסן את הקבצים בעצמם כשקיימת אפשרות לפנות לשירותי ענן שמריצים אותו דרך SGLang כמו chutes.ai.

אם בכל זאת מריצים עצמאית, אפשר לעבוד עם vLLM או SGLang בגרסאות מעודכנות. קריאות לכלים ופונקציות דורשות התאמה ידנית ולא עובדות מהקופסה, כך שב־vLLM צריך לטעון פלאגין מתוך קובץ הפייתון המצורף, וב־SGLang נדרש תיקון ידני לקוד המנוע.

from transformers import pipeline

pipe = pipeline("text-generation", model="tngtech/DeepSeek-TNG-R1T2-Chimera")
print(pipe("שלום"))

הקבצים

175 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לארח אותו או לשלב אותו במוצרים פנימיים וחיצוניים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗