GPT
O

Olmo-3.1-32B-Think

קוד פתוח

allenaiapache-2.02025-12-10

  • transformers
  • safetensors
  • olmo3
  • text-generation
  • conversational

מודל פתוח לגמרי של 32 מיליארד פרמטרים שמייצר שרשרת חשיבה מפורטת לפני שהוא עונה. Ai2 בנו אותו במיוחד כדי להתחרות בקוד ומתמטיקה מול מודלי חשיבה סגורים.

  • 32Bפרמטרים
  • 65,536טוקנים בהקשר
  • 60.0 GBמשקל הקבצים
  • 5,262הורדות בחודש

מה זה

מדובר במודל שפת ברירת מחדל באנגלית שעבר אימון ייעודי לפתרון בעיות מורכבות באמצעות שרשרת חשיבה מתמשכת בתוך תגיות think. הוא אומן בשיטת חיזוק מתגמולים הניתנים לאימות (RLVR) לצד DPO, מה שמאפשר לו לפרק שאלות טכניות בצורה מסודרת.

במבחני מתמטיקה וקוד הוא מציג מספרים מרשימים, עם 96.2 במבחן MATH ו־83.3 ב־LiveCodeBench v3, תוצאות שמציבות אותו מעל DeepSeek-R1-Distill-Qwen-32B בתחומים האלה. מנגד, בידע כללי ושאלות טריוויה הוא נחלש, כפי שנראה בציון של 30.9 בלבד ב־PopQA, מה שאומר שהוא מתאים בעיקר ככלי חישובי ולוגי ולא כמקור ידע אנציקלופדי.

מתאים ל

  • פתרון בעיות מתמטיקה

    קיבל 96.2 במבחן MATH ומשתמש בשרשרת חשיבה פנימית שמפרקת את החישובים שלב אחרי שלב.

  • יצירת קוד ובדיקות

    מציג ציון של 91.5 ב־HumanEvalPlus ומתאים לכתיבת פונקציות ואלגוריתמים מורכבים באנגלית.

  • ביצוע הוראות מורכבות

    מגיע ל־93.8 ב־IFEval, ציון שמבטיח הקפדה גבוהה על אילוצי פורמט והנחיות מדויקות.

איפה זה נופל

המודל פותח ונבדק באנגלית בלבד, ואין לו תמיכה רשמית או בדיקות בעברית. בנוסף, המפתחים מציינים בפירוש שאין בו סינון בטיחות קשיח ולכן משתמשים יכולים לחלץ ממנו פלטים פוגעניים או מוטים בקלות. נקודת תורפה נוספת היא דיוק עובדתי, שכן מבדקי שליפת המידע שלו נמוכים, ומייצרים הזיות כשמבקשים ממנו עובדות יבשות.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הכרטיס מגדיר את השפה הנתמכת כאנגלית בלבד. המודל לא עבר אימון או התאמה לעברית, ולכן לא מומלץ להסתמך עליו למשימות בשפה המקומית ללא בדיקה יסודית או אימון המשך ייעודי.

איך מקבלים רק את התשובה הסופית בלי שרשרת החשיבה?

הפלט מייצר תגיות think שמכילות את כל תהליך ההסקה לפני התשובה. כדי להציג רק את התוצאה למשתמש הקצה, צריך לחתוך את הטקסט שנמצא בין התגיות הללו ברמת הקוד שמטפל בפלט.

איך מריצים

המשקל הגולמי של הקבצים עומד על 60 גיגה־בייט, מה שאומר שצריך לפחות שני כרטיסי A100 או H100 כדי להריץ אותו ב־FP16 מלא. מי שמחזיק כרטיס בודד של 24 גיגה־בייט כמו RTX 3090 או 4090 יצטרך לכווץ אותו ל־8 ביט בעזרת bitsandbytes או קוונטיזציה נמוכה יותר.

אפשר להריץ אותו דרך ספריית transformers החל מגרסה 4.57.0 או באמצעות vLLM, והמפתחים ממליצים על טמפרטורה של 0.6. אם אתם לא מחזיקים שרת GPU זמין ורציף, להחזיק מופע ענן פעיל למשקל כזה יעלה לכם לא מעט ביחס לקריאות API פשוטות.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/Olmo-3.1-32B-Think")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מופצים תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה של המודל בחינם. Ai2 מצרפת בקשה לפעול לפי קווי ההנחיה לשימוש אחראי שלה, אך תנאי הרישיון עצמם הם חופשיים לחלוטין וללא תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗