GPT
S

s1-32B

קוד פתוח

simplescalingapache-2.02025-01-14

  • safetensors
  • qwen2
  • text-generation
  • conversational

אימון של אלף דוגמאות בלבד על בסיס קיים יצר מודל חשיבה תחרותי. הוא מתאים למי שרוצה ביצועי היגיון ומתמטיקה חזקים בקוד פתוח בלי להסתמך על ענקיות סגורות.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 122 GBמשקל הקבצים
  • 239הורדות בחודש

מה זה

מדובר במודל שפותח על בסיס Qwen2.5-32B-Instruct ועבר כוונון עדין על אלף דוגמאות בלבד. הרעיון המרכזי כאן הוא בדיקת גבולות החשיבה בזמן הסקה, טכניקה שבה מכריחים את המודל להמשיך לחשוב על ידי התעלמות מסיום החשיבה והוספת המילה Wait עד ארבע פעמים. זה מאפשר לו להתחרות ישירות במודלים מסחריים כמו o1-preview במשימות היגיון מורכבות.

במבחני מתמטיקה כמו MATH500 הוא מגיע לציון של 93.0, ועוקף את o1-preview שעומד על 81.4. במבחן AIME2024 הוא משיג 56.7 לעומת 40.0 של המתחרה הסגור. עם זאת, במבחן המדעים GPQA-Diamond הוא מגיע ל־59.6 ונשאר מאחור, מה שמראה שהחוזק העיקרי שלו מרוכז בפתרון בעיות חישוביות ופחות בידע מדעי כללי רחב.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מגיע לציון 93.0 במבחן MATH500 בזכות מנגנון חשיבה מאולץ שבודק את התשובה שוב.

  • היסק לוגי בקוד פתוח

    מתאים למי שחייב מודל חושב מקומית בתוך רשת סגורה, ללא תלות בשרתי צד שלישי.

  • מחקר על זמני הסקה

    הארכיטקטורה שלו מאפשרת לבחון טכניקות של כפיית חשיבה על מודל בסיס פתוח.

איפה זה נופל

היוצרים עצמם ממליצים להשתמש בגרסת ההמשך שלו, s1.1, שמציגה תוצאות טובות יותר. במבחן AIME2025 I המודל הזה מתרסק ל־26.7 בעוד שהגרסה החדשה מגיעה ל־60.0, כך שיש לו נפילות חדות בבעיות חדשות.

בנוסף, כל התוצאות המרשימות שלו הושגו רק בעזרת מניפולציית תקציב חשיבה כפויה. בלי הזרקת פקודת ההמתנה בזמן הריצה, הביצועים שלו יהיו נמוכים משמעותית ממה שמוצג בטבלאות.

שאלות
נפוצות

האם כדאי לבחור בו לפרויקט חדש?

עדיף שלא. היוצרים עצמם מציינים במפורש בעמוד המודל שעדיף להשתמש בגרסה הבאה, s1.1-32B, שמציגה שיפור משמעותי במבחנים.

איך משחזרים את התוצאות שמפורסמות במבחנים?

צריך לממש את מנגנון תקציב החשיבה בקוד הריצה שלכם. זה כולל התעלמות מסימון סיום החשיבה והזרקת המילה Wait עד ארבע פעמים כדי לחייב אותו להמשיך לעבוד.

איך מריצים

המשקל המלא של הקבצים מגיע ל־122 גיגה בייט בפורמט float32, כך שאי אפשר להריץ אותו כמו שהוא על כרטיס ביתי. תצטרכו שרת עם לפחות שני כרטיסי A100 או H100, או לבצע קוונטיזציה ל־4 או 8 ביט כדי לדחוס אותו לכרטיס בודד של 24 או 48 גיגה בייט זיכרון.

אם אתם צריכים רק לבדוק שאילתות בודדות או שאין לכם תשתית ענן זמינה, החזקה עצמית של שרת כזה תעלה הרבה יותר מפנייה ישירה למודל קנייני דרך API. הטרחה בהרצה מקומית משתלמת בעיקר אם המידע רגיש ולא יכול לצאת מהרשת המקומית שלכם.

pip install -U huggingface_hub
hf download simplescaling/s1-32B

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית לכל מטרה. אתם יכולים לשלב אותו במוצר שלכם, להתקין אותו אצל לקוחות או להציע אותו כשירות, בתנאי שאתם שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗