GPT
M

MAI-DS-R1

קוד פתוח

microsoftmit2025-04-16

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסה של מיקרוסופט למודל DeepSeek-R1, שעברה אימון נוסף כדי לשחרר נושאים שהיו חסומים במקור. היא שומרת על יכולות ההסקה ומצמצמת פליטה של תוכן מזיק.

  • 671Bפרמטרים
  • 163,840טוקנים בהקשר
  • 1.2 TBמשקל הקבצים
  • 575הורדות בחודש

מה זה

מיקרוסופט לקחה את מודל ההסקה DeepSeek-R1 והעבירה אותו כוונון עדין על 110 אלף דוגמאות בטיחות ממאגר Tulu ועוד כ־350 אלף דוגמאות רב-לשוניות. המטרה היתה לפתור את בעיית הצנזורה בנושאים פוליטיים ורגישים שהמודל המקורי סירב לענות עליהם, בלי להרוס את יכולות החשיבה המתמטית והקוד.

במבחני ביצועים של נושאים חסומים, המודל שחרר 99.3% מהשאילתות החסומות, בדומה לגרסת R1-1776 של Perplexity, אך קיבל ציוני רלוונטיות גבוהים יותר. לפי נתוני הבדיקה, הוא גם הציג שיעור דליפה נמוך יותר של תוכן מזיק ומסוכן לעומת המודל המקורי ולעומת R1-1776, במיוחד במבחנים של HarmBench, תוך שמירה על רמת פתרון בעיות זהה למקור.

מתאים ל

  • פתרון בעיות מתמטיקה ומדע

    מתאים לשרשרת חשיבה מורכבת במדע ומתמטיקה בזכות יכולות ההסקה של המקור שנשמרו במלואן.

  • כתיבה וניתוח קוד

    מספק סיוע בתכנות, פתרון באגים והסבר קטעי קוד מורכבים ברמה גבוהה.

  • מענה על שאלות ללא צנזורה

    עונה על נושאים היסטוריים ופוליטיים שהמודל המקורי סירב להתייחס אליהם.

איפה זה נופל

למרות השחרור של נושאים חסומים, המודל שומר על נקודת חיתוך הידע של המודל המקורי, ולכן חסר לו מידע על אירועים עדכניים. הוא עדיין מייצר הזיות בעובדות מסוימות ופגיע לפרומפטים עוינים. בנוסף, אף שהאימון כלל דוגמאות רב-לשוניות, הביצועים שלו חזקים בעיקר באנגלית ובסינית, כך שבעברית איכות התשובות עשויה לרדת. הכרטיס מזהיר במפורש שהמודל עלול לפלוט תכנים רגישים מבחינה פוליטית, ויש להפעיל מערכות סינון ובקרה אנושית אם משלבים אותו במוצר.

שאלות
נפוצות

האם המודל שונה ביכולות ההסקה שלו מ־DeepSeek-R1 הרגיל?

מבחני הביצועים מראים שהיכולות הכלליות במתמטיקה ובקוד נשארו זהות למקור. השינוי המרכזי שמיקרוסופט עשתה הוא הורדת החסימות בנושאים פוליטיים ושיפור הסינון של תכנים מזיקים ומסוכנים.

האם אפשר להריץ אותו על שרת מקומי רגיל?

לא. הקבצים שוקלים 1.2 טרה-בייט ומכילים 671 מיליארד פרמטרים. תצטרכו שרת ייעודי עם מספר כרטיסי מסך ארגוניים מתקדמים רק כדי להעלות אותו לזיכרון.

איך מריצים

כדי להריץ מודל במשקל 1.2 טרה-בייט בדיוק מלא צריך תשתית שרתים כבדה מאוד. מדובר בארכיטקטורת תערובת מומחים עם מאות מיליארדי פרמטרים, מה שמחייב קלאסטר מרובה כרטיסי מסך עם זיכרון משותף עצום רק כדי לטעון את המשקלים ל־RAM.

לרוב המפתחים והצוותים אין טעם לתחזק שרתים כאלה עצמאית. כל עוד אין לכם צורך מובהק באבטחת מידע הדורשת סביבה מבודדת לחלוטין, עדיף להשתמש ב־API של ספק ענן שמארח אותו, במקום לנהל פריסה של 334 קבצי מודל והקצאת חומרה של עשרות אלפי דולרים.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/MAI-DS-R1")
print(pipe("שלום"))

הקבצים

334 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון פתוח ומתירני במיוחד, שמאפשר שימוש מסחרי מלא, שינוי הקוד והמשקלים, הפצה ושילוב במוצרים סגורים. הדרישה העיקרית היא שמירה על הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗