GPT
O

Olmo-3-32B-Think

קוד פתוח

allenaiapache-2.02025-11-19

  • transformers
  • safetensors
  • olmo3
  • text-generation
  • conversational

מודל פתוח לגמרי של 32 מיליארד פרמטרים שמייצר שרשרת חשיבה מפורטת לפני שהוא עונה. הוא מיועד למי שרוצה ביצועי היגיון וקוד חזקים בלי תלות בעננים סגורים.

  • 32Bפרמטרים
  • 65,536טוקנים בהקשר
  • 60.0 GBמשקל הקבצים
  • 8,012הורדות בחודש

מה זה

אלן AI בנו את המודל הזה על בסיס ארכיטקטורת Olmo3 עם 64 שכבות, ואימנו אותו בשלושה שלבים ברורים: כוונון עדין, אופטימיזציית העדפות, וחיזוק מבוסס תגמולים שניתן לאימות. הדגש המרכזי כאן הוא תהליך חשיבה ארוך בתוך תגיות ייעודיות לפני הפלט הסופי. זה משפר את הדיוק במתמטיקה ובכתיבת קוד בצורה מורגשת ביחס למודלים רגילים שלא עוצרים לחשוב.

במבחני ביצועים הוא עומד בכבוד מול מתחרים ישירים. ב־AIME 2025 הוא מגיע לציון 72.5, מעל DeepSeek-R1-Distill בגרסת ה־32B שמשיג 56.3 בלבד. ב־MATH הוא מגיע ל־96.1, וב־LiveCodeBench v3 הוא רושם 83.5 נקודות. המשמעות היא שבמשימות אלגוריתמיות ופתרון בעיות טכניות, המודל הזה לא סתם מנחש את הטוקן הבא אלא מפרק את הבעיה לעומק, מה שמצמצם שגיאות חישוב גסות.

מתאים ל

  • פתרון בעיות מתמטיקה

    מציג 96.1 במבחן MATH ומשתמש בשרשרת חשיבה מובנית שמפרקת משוואות שלב אחר שלב.

  • ייצור ובדיקת קוד

    משיג 83.5 ב־LiveCodeBench ומסוגל לבדוק מקרי קצה באופן מתוכנן לפני החזרת הפונקציה.

  • מחקר על תהליכי חשיבה

    כל שלבי האימון, הנתונים ונקודות הביקורת שוחררו בצורה גלויה לקהילה.

איפה זה נופל

המודל מוגדר רשמית לשפה האנגלית בלבד, כך שלא הייתי בונה עליו לשום משימה בעברית בלי לבדוק אותו קודם בצורה קפדנית. מעבר לזה, הכרטיס מודה בפירוש שאין פילטור בטיחות מובנה, וציון הבטיחות שלו עומד על 68.8, נמוך בהרבה ממתחרים כמו Qwen שמגיעים למעל 80. הוא עלול לפלוט תוכן פוגעני או שגוי אם לא שמים מולו שכבת הגנה נפרדת, וידע העולם הכללי שלו נעצר בסוף שנת 2024.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי אחד?

במשקלו המלא ממש לא, צריך 60 גיגה רק לקבצים ועוד זיכרון לריצה. אפשר לנסות להריץ אותו רק עם קוונטיזציה של 8 ביט ומעלה, וגם אז תצטרכו לפחות כרטיס של 32 גיגה זיכרון.

האם הוא יודע לעבוד בעברית?

החומר הרשמי מגדיר אותו באנגלית בלבד. סביר שהוא יפלוט טקסט משובש או יתקשה בהיגיון בסיסי אם תפנו אליו בעברית.

מה היתרון שלו על פני מודלי Instruct רגילים?

הוא מאומן לעצור ולכתוב לעצמו מחשבות בתוך תגיות ייעודיות לפני שהוא מייצר את התשובה הסופית, מה שמקפיץ משמעותית את הדיוק במשימות מורכבות.

איך מריצים

המשקל המלא של הקבצים מגיע ל־60 גיגה־בייט. בשביל להריץ אותו בלי קוונטיזציה תצטרכו לפחות 80 גיגה זיכרון גרפי, כלומר שני כרטיסי A6000 או כרטיס H100 בודד. אפשר גם לטעון אותו ב־8 ביט עם bitsandbytes ישירות דרך transformers כדי לחסוך מקום, או להרים אותו דרך vllm עם הטמפרטורה המומלצת שהיא 0.6.

אם אין לכם שרת ייעודי זמין, התחזוקה של חומרה כזו יקרה ומסורבלת. במקרה כזה עדיף לצרוך API של ספק צד שלישי שמארח את המשקלים, אלא אם מדובר במידע פנימי שחייב להישאר ברשת המקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/Olmo-3-32B-Think")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים והפצה חופשית בתוך מוצרים. היוצרים מצרפים המלצה למחקר ולחינוך בהתאם לקווי ההנחיה שלהם, אך מבחינה משפטית הרישיון חופשי לחלוטין.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗