GPT
D

DeepSeek-R1-Zero

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

גרסת ניסוי לא מעובדת שנבנתה כדי לבדוק איך מודל לומד לחשוב לבד באמצעות חיזוקים בלבד. הוא מייצר שרשראות חשיבה מורכבות, אבל לא עבר התאמה עדינה לשיחה נוחה.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 10,121הורדות בחודש

מה זה

הארכיטקטורה מבוססת על מודל בסיס עם 685 מיליארד פרמטרים שמשפעל 37 מיליארד בכל טוקן. המאפיין הייחודי שלו הוא האימון. הצוות לקח את מודל הבסיס והריץ עליו למידת חיזוק ישירה בהיקף רחב, בלי אימון מונחה מקדים ובלי דוגמאות מוכנות של בני אדם לאיך פתרון צריך להיראות.

התוצאה של הניסוי הזה היא התנהגויות של חשיבה עצמאית, בדיקה עצמית של טעויות ורפלקציה תוך כדי כתיבה. המודל מייצר שרשראות חשיבה ארוכות בעצמו. בניגוד לגרסת R1 המלאה שכוללת נתוני אתחול ואימון עדין כפול כדי ליישר קו עם שיחה אנושית, הגרסה הזו נשארה כפי שיצאה מהחיזוקים, מעין חלון ישיר ליכולת ההסקה הגולמית שנלמדה.

מתאים ל

  • מחקר על התנהגות למידת חיזוק

    מאפשר לחקור איך מודל לומד בדיקה עצמית בלי הנחיה אנושית מוקדמת.

  • ניתוח שרשראות חשיבה גולמיות

    מספק הצצה לתהליכי פתרון מתמטיים לפני שמנגנוני בטיחות ונימוס מעצבים אותם.

  • איסוף דאטה לזיקוק עצמאי

    הרישיון החופשי מתיר להפיק ממנו נתונים כדי לאמן מודלים פנימיים קטנים.

איפה זה נופל

המודל הזה סובל מבעיות חמורות בשימושיות. המפתחים עצמם מודים שהוא נתקע בלולאות של חזרתיות אינסופית, סובל מקריאות נמוכה מאוד, ומערבב שפות בתוך אותה תשובה בלי שליטה. הוא גם נוטה לפעמים לדלג על דפוס החשיבה בכלל אם לא מכריחים אותו להתחיל את הפלט עם תגית החשיבה. אסור להכניס אותו למוצר שמשתמשי קצה רואים.

שאלות
נפוצות

האם כדאי להשתמש בזה במקום בגרסת R1 הרגילה?

לא, אלא אם אתם חוקרים במפורש התנהגות של למידת חיזוק טהורה. הגרסה הרגילה כוללת אימון מונחה שמסדר את השפה, משפר קריאות ומונע את ערבוב השפות והחזרות המעיקות שקיימות בגרסת הזירו.

איך צריך לבנות את הפרומפט כדי שהוא יעבוד נכון?

ההנחיה היא לא להשתמש בפרומפט מערכת אלא לכתוב את כל ההוראות בבקשת המשתמש. מומלץ לכפות עליו להתחיל את הפלט עם תגית חשיבה, לכוון טמפרטורה לאזור 0.6, ולבקש פתרון צעד אחר צעד כדי למנוע ממנו לדלג על ההסקה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־641 ג'יגה־בייט בפורמט bfloat16. להריץ דבר כזה לבד דורש שרת עם מספר כרטיסי מסך רבי עוצמה שמסוגלים להחזיק מאות ג'יגה־בייט של זיכרון גרפי, תשתית שרוב המפתחים לא מחזיקים במשרד. בנוסף, בכרטיס המודל נכתב במפורש שספריית transformers עדיין אינה תומכת בו ישירות, ומפנים למאגר של DeepSeek-V3 להוראות הרצה.

אם אין לכם אשכול מחשוב ייעודי למחקר, עדיף בהרבה להשתמש ב־API שהם מציעים או לבחור בגרסאות המזוקקות הקטנות, כמו אלו של 8B או 32B, שרצות בקלות על חומרה מקומית סטנדרטית עם vLLM או SGLang.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-Zero")
print(pipe("שלום"))

הקבצים

174 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT מלא. מותר לעשות עם המשקלים והקוד כמעט הכל, כולל שימוש מסחרי, שינויים, הפצה מחדש ושימוש בפלטים כדי לזקק ולאמן מודלים אחרים, בלי תמלוגים או הגבלות תאגידיות כובלות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗