GPT
D

DeepSeek-R1T-Chimera

קוד פתוח

tngtechmit2025-04-26

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

מיזוג משקלים שמחבר את יכולות החשיבה של מודל ההסקה עם יעילות הטוקנים של מודל הבסיס. פתרון למי שרוצה חשיבה עמוקה בלי לשלם על יצירת פלט ארוך ומיותר.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 134הורדות בחודש

מה זה

הפיתוח הזה הוא שילוב משקלים ישיר בין DeepSeek-R1 לבין DeepSeek-V3 בגרסת מרץ 2025. המטרה של המיזוג היא לקחת את יכולת ההסקה והלוגיקה המורכבת של גרסת הריזונינג, אבל לצמצם את כמות הטוקנים המנופחת שהיא נוטה לייצר בדרך לפתרון, תכונה שנלקחה ישירות מגרסת ה־V3 הרגילה.

בגודל של 685 מיליארד פרמטרים בארכיטקטורת תערובת מומחים, הוא מציע חלון הקשר ענקי של 163,840 טוקנים. במקום לבחור בין מודל שמייצר מגילות מחשבה לבין מודל צ'אט מהיר אבל פחות מעמיק, השילוב הזה מנסה לתת דיוק גבוה במשימות מורכבות תוך שמירה על מהירות תגובה סבירה יותר וחיסכון בעלויות החישוב.

מתאים ל

  • פתרון בעיות קוד סבוכות

    ניתוח באגים מורכבים שדורשים חשיבה לוגית עמוקה בלי לבזבז זמן על פלט מרוח מדי.

  • עיבוד מסמכים ארוכים

    חלון הקשר של מעל 160 אלף טוקנים מתאים לניתוח תיעוד טכני נרחב או חוזים מורכבים.

  • מחקר והשוואת מיזוגים

    בסיס מצוין לחוקרים שרוצים לבדוק איך טכניקות חיבור משקלים מתנהגות במודלי ענק.

איפה זה נופל

מיזוג משקלים הוא לא אימון מאפס ולעיתים קרובות הוא גורם להתנהגות לא צפויה, פגיעה ביציבות התשובות או ירידה באיכות במשימות שלא נבדקו היטב. המפתחים עצמם לא מפרטים מבחני ביצועים מלאים בטקסט של הכרטיס אלא מפנים למאמר, וכבר הוציאו גרסה חדשה יותר בשם R1T2 שמבטיחה להיות מהירה וחכמה יותר מזו.

בנוסף, הכרטיס לא מגדיר מגבלות סיכון משל עצמו אלא מפנה להנחיות הבטיחות של מיקרוסופט עבור המודל שלהם, מה שמחייב אתכם לבדוק את התוצרים ידנית לפני חיבור ישיר למערכות ייצור.

שאלות
נפוצות

האם כדאי לבחור בו לפרויקט חדש?

לא בטוח, במיוחד כשהיוצרים עצמם כבר ציינו ששחררו גרסה משופרת בשם R1T2. אם אתם רוצים את המודל העדכני ביותר של הסדרה הזו, כדאי לבדוק קודם את הגרסה החדשה.

האם אפשר להריץ אותו על מחשב פיתוח חזק?

ממש לא. הקבצים לבדם שוקלים מעל שש מאות גיגה בייט, כך ששום תחנת עבודה רגילה לא תצליח לטעון אותו ללא חומרת שרתים מקצועית מרובת כרטיסים גרפיים.

איך מריצים

כדי להריץ 641 גיגה בייט של משקלים בדיוק מקורי, אתם צריכים שרת ייעודי עם לפחות שמונה מאיצי H100 או A100 של שמונים גיגה, וגם זה רק בשביל לטעון אותו לזיכרון לפני שמחשבים את זיכרון ההקשר. חומרה כזו עולה הון ודורשת תשתית רשת מהירה במיוחד בין הכרטיסים.

לרוב המפתחים והצוותים אין סיבה כלכלית להרים שרת כזה בעצמם. המודל זמין להתנסות בחינם דרך OpenRouter, כך שאלא אם אתם מחויבים לפרטיות מוחלטת של המידע בתוך רשת מקומית, עדיף בהרבה לצרוך אותו דרך ספקי ענן קיימים שסופגים את עלות החומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="tngtech/DeepSeek-R1T-Chimera")
print(pipe("שלום"))

הקבצים

173 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר שיש לכם חופש מלא לעשות איתו כמעט הכל. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, למזג אותו עם קוד סגור ולפרוס אותו במוצר שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗