GPT
D

DeepScaleR-1.5B-Preview

קוד פתוח

agentica-orgmit2025-01-29

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • en

זה מודל קטן של 1.8 מיליארד פרמטרים שמתמחה בפתרון בעיות מתמטיקה קשות. הוא נועד למי שרוצה ביצועי חשיבה תחרותיים בלי להחזיק שרתים כבדים.

  • 1.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.6 GBמשקל הקבצים
  • 3,646הורדות בחודש

מה זה

הבסיס כאן הוא המודל המזוקק DeepSeek-R1-Distill-Qwen-1.5B, שעבר אימון חיזוק מבוזר בשיטת GRPO על כארבעים אלף שאלות מתמטיקה. הרעיון המרכזי היה הרחבה הדרגתית של ההקשר בזמן האימון, משמונה אלפים ועד מעבר לעשרים וארבעה אלף טוקנים, כדי ללמד אותו לייצר שרשראות חשיבה ארוכות בלי לקרוס תחת עלויות החישוב.

במדד AIME 2024 הוא מגיע לדיוק של 43.1 אחוזים, קפיצה של כמעט חמישה עשר אחוזים ביחס למודל הבסיס שממנו הוא נוצר. המספר הזה עוקף לפי המדידות של המפתחים גם את o1-preview, ומציג ממוצע של 57 אחוזים על פני מבחני מתמטיקה אקדמיים ותחרותיים, תוצאה חריגה מאוד למשקל נוצה כזה.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מיומן במיוחד בשאלות תחרותיות כמו AIME ומספק דיוק גבוה ביחס לגודל שלו.

  • אימות ציונים ופתרונות

    משתלב כמנוע חישוב מקומי שבודק תשובות מדעיות ומפיק חישובים מדויקים בזול.

  • מחקר על שרשראות חשיבה

    משמש בסיס נוח לבדיקת יכולות הסקה ארוכות על חומרה זולה ונגישה.

איפה זה נופל

המודל אומן בצורה צרה מאוד על שאלות מתמטיות סגורות עם בדיקות תקינות בקוד. פונקציית התגמול חילקה אפס או אחת לפי תשובה סופית מדויקת, בלי משוב על שלבי הביניים. המיקוד הזה הופך אותו ללא מתאים לשיחה חופשית, כתיבת טקסט, תכנות כללי או עבודה בעברית.

שאלות
נפוצות

האם המודל יודע לענות בעברית?

הכרטיס מגדיר תמיכה באנגלית בלבד. כל הנתונים שעליהם אומן הגיעו ממאגרי מתמטיקה באנגלית, ולכן לא מומלץ להשתמש בו לקלט או פלט בעברית.

למה שהמודל הזה יתאים יותר ממודל 7B רגיל?

במבחני מתמטיקה מורכבים הוא משיג 43.1 אחוזים לעומת פחות משלושים אחוזים במודלים כלליים של 7B. הוא ממוקד בהסקה ארוכה ותופס חצי מכמות הזיכרון.

איך מריצים

בגודל של 6.6 גיגה בייט בפורמט float32, אפשר להריץ אותו בקלות על כרטיס מסך בודד של צרכנים עם 8 או 16 גיגה זיכרון. כלי הסקה כמו vLLM, SGLang, TGI או TensorRT-LLM תומכים בארכיטקטורה שלו מהקופסה ומספקים ממשק תואם OpenAI.

הקריאה לשרת עצמאי משתלמת במיוחד אם רוצים לשלב אותו בלולאות אימות או שרשראות חשיבה ארוכות בלי לשלם לפי טוקן. אם אתם צריכים רק מענה מזדמן לשאלות כלליות, עדיף להשתמש בחיבור ישיר למודלים חיצוניים גדולים ולא לתחזק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="agentica-org/DeepScaleR-1.5B-Preview")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בקוד סגור. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית בתוך הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗