GPT
Z

ZR1-1.5B

קוד פתוח

Zyphramit2025-04-07

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

מודל חשיבה קומפקטי שמביא יכולות מתמטיקה וקוד של ענקים לכרטיס מסך ביתי בודד. הוא נולד מאימון חיזוק ישיר על תרגילים מאומתים, בלי משקל עודף.

  • 1.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.6 GBמשקל הקבצים
  • 2,368הורדות בחודש

מה זה

המודל הזה לוקח את ארכיטקטורת Qwen2 עם כ־1.8 מיליארד פרמטרים ודוחף אותה לקיצון בתחומי פתרון בעיות. במקום להסתמך רק על חיקוי תשובות, המפתחים אימנו אותו בשיטת PRIME עם תגמול מדורג על מאות אלפי שאלות מתמטיות ועשרות אלפי תרגילי קוד מרובי בדיקות. התוצאה היא כושר היסק שמתחרה ישירות בדגמים עצומים, כולל ציון של 40% ב־Leetcode ו־37.91% ב־GPQA-Diamond, רמה שעוקפת לעיתים דגמים כבדים בהרבה כמו Llama-3.1-70B-Instruct במשימות ספציפיות.

ההבדל הגדול מול דגמי 1.5B אחרים הוא היכולת לייצר שרשראות חשיבה ארוכות של עשרות אלפי טוקנים בלי לאבד כיוון. הוא לא מנסה להיות עוזר כללי שמפטפט על פילוסופיה או כותב שירים. כל המשקל שלו מוקדש למעקב שלב אחר שלב אחרי בעיות אלגוריתמיות ונוסחאות, מה שמאפשר לו להוציא תוצאות עקביות גם כשהשאלה דורשת עבודה מעמיקה.

מתאים ל

  • פתרון חידות אלגוריתמיות

    מתאים לפתרון בעיות בסגנון Leetcode בזכות אימון ייעודי על טסטים.

  • בודק מתמטיקה אוטומטי

    מנתח ופותר בעיות קשות עם 88.34% דיוק במבחן MATH500.

  • מנוע חשיבה במכשיר קצה

    רץ בשלמותו בתוך זיכרון של מחשב פיתוח רגיל בלי שרתים חיצוניים.

איפה זה נופל

הנתונים חושפים פער חד ברגע שיוצאים מפתרון בעיות טהור. במבחן השלמת קוד (Coding Completion) ב־LiveBench הוא מגרד רק 12%, מה שאומר שכעוזר השלמה בזמן אמת בתוך עורך קוד הוא כמעט חסר תועלת מול דגמי 14B ו־32B. בנוסף, הוא מאומן באנגלית בלבד ואין בו תמיכה בשפות אחרות, כך שפניות בעברית ייכשלו או ייצרו פלט משובש. הוא גם תוכנן לייצר תשובות ארוכות מאוד, וכאשר כופים עליו קיצוץ לפחות מ־2,048 טוקנים, הדיוק המתמטי שלו צונח משמעותית.

שאלות
נפוצות

האם אפשר להשתמש בו בתור Copilot בתוך ה־IDE שלי?

לא מומלץ. בבדיקות של השלמת קוד רציפה הוא הגיע ל־12% בלבד, שזה ציון נמוך מאוד. הוא מתאים לפתרון פונקציה מוגדרת היטב מאפס ולא להשלמת שורות תוך כדי כתיבה.

כמה זיכרון כרטיס מסך בפועל צריך כדי להריץ אותו?

הקבצים שוקלים 6.6 גיגה־בייט בדיוק המקורי. כרטיס עם 12 גיגה־בייט יחזיק את המודל בקלות וישאיר מקום לשרשראות החשיבה הארוכות שלו.

האם הוא מסוגל לקרוא שאלות בעברית?

הכרטיס מצהיר על אנגלית בלבד. המודל לא עבר התאמה לשפות נוספות, ולכן עדיף להזין את השאלות וההנחיות באנגלית כדי לא לפגוע באיכות הפתרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 6.6 גיגה־בייט בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 8 עד 12 גיגה זיכרון מריץ אותו מקומית בלי שום קושי. הוא עובד ישירות מעל transformers, אבל המפתחים מספקים פקודת הרצה מותאמת ל־SGLang עם דגלים ספציפיים לביטול radix cache ו־chunked prefill כדי לשמור על דיוק החישוב.

אם אתם צריכים רק בדיקות נקודתיות של קוד או תרגיל בודד פעם בשעה, קריאה למודל ענן חזק תחסוך את ההתעסקות. מצד שני, אם אתם מריצים פתרון של מאות חידות או סריקת מבחני קוד בתוך סביבה מבודדת, אין הצדקה לשלם ל־API חיצוני כשאפשר להריץ שרת מקומי קל ומהיר על חומרה זמינה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Zyphra/ZR1-1.5B")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא. אפשר לקחת את המשקלים, לשלב אותם במוצר מסחרי, להריץ אותם בשרתים פרטיים או לשנות את הקוד בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית של Zyphra בקבצי הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗