GPT
O

OLMo-2-0325-32B

קוד פתוח

allenaiapache-2.02025-02-23

  • transformers
  • safetensors
  • olmo2
  • text-generation
  • en

מודל פתוח לגמרי בגודל 32 מיליארד פרמטרים, שמגיע עם שקיפות מלאה על נתוני האימון וקוד המקור. מתאים למי שרוצה בסיס כבד לאימון עצמאי ולא מוכן לתלות ברישיונות סגורים.

  • 32Bפרמטרים
  • 4,096טוקנים בהקשר
  • 120 GBמשקל הקבצים
  • 7,726הורדות בחודש

מה זה

מדובר במודל שפה גולמי מסדרת המודלים הפתוחים של מכון אלן לבינה מלאכותית, שאומן על 6 טריליון טוקנים בשלב הראשון ועבר שלב ביניים נוסף עם מיזוג משקלים. הוא שונה מרוב מה שיש בשוק לא בביצועים, אלא בפתיחות המוחלטת שלו. כל הדאטה סטים ששימשו לאימון, כמו OLMo-mix-1124 ו־Dolmino-mix-1124, זמינים לציבור יחד עם נקודות הביקורת של תהליך הריצה.

במבחני הביצועים הוא מציג ממוצע של 72.9 נקודות. זה מציב אותו מעל Gemma-2-27B שמגיע ל־71.3, אבל מתחת ל־Qwen-2.5-32B שמשיג 74.9 עם דרישות דומות. במתמטיקה עם GSM8k הוא מקבל 78.8 לעומת 83.3 של Qwen, ובידע כללי ב־MMLU הוא רושם 74.9. המשמעות היא שמקבלים יכולת סבירה מאוד לקטגוריה, אך המטרה כאן היא חקר והתאמה אישית ולא שיא היעילות.

מתאים ל

  • אימון מודל המשך ייעודי

    בסיס מצוין ל־fine-tuning של ארגונים שרוצים שליטה מלאה בכל שלבי הלמידה והנתונים.

  • מחקר אקדמי על מודלי שפה

    קוד המקור, המשקלים מכל נקודות הזמן והדאטה הפתוח מאפשרים ניתוח מדויק של תהליך האימון.

  • השלמת טקסט וקוד באנגלית

    מתאים למערכות שדורשות המשך ישיר של תבניות קבועות ללא צורך בממשק שיחה.

איפה זה נופל

זה מודל בסיס בלבד, ולא מודל שעבר התאמה לשיחה. אם תשאלו אותו שאלה הוא עשוי פשוט להמשיך את הטקסט במקום לענות. תאריך העדכון שלו נעצר בדצמבר 2023, והוא אומן באנגלית בלבד, כך שאין מה לצפות לביצועים סבירים בעברית. חלון ההקשר עומד על 4,096 טוקנים בלבד, מגבלה קשה ביחס לסטנדרטים הנוכחיים של עשרות אלפי טוקנים, מה שפוסל אותו לניתוח מסמכים ארוכים.

אותה משפחה

OLMo-2-0325 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לפיתוח בוט שיחה בארגון?

לא כפי שהוא. זהו מודל בסיס שנועד להשלמת טקסט, וכדי לבנות בוט צריך להשתמש בגרסת ה־Instruct או לבצע תהליך SFT ו־DPO בעצמכם.

האם אפשר להשתמש בו ליישומים שדורשים עברית?

לא מומלץ בכלל. המודל הוגדר ואומן על אנגלית בלבד, והתוצאות בעברית יהיו שבורות ולא מדויקות.

איך מריצים

כדי לטעון את המשקלים המקוריים בדיוק מלא תצטרכו 120 ג'יגה בייט של זיכרון, שזה לפחות שני כרטיסי A100 או H100 של 80GB. אפשר לקוונטט אותו ל־8 ביט עם ספריית bitsandbytes כדי להסתפק בכרטיס בודד, אבל היצרן מציין שבמצב כזה המודל רגיש מאוד לסוגי טיפוסים ופעולות זיכרון, וצריך להעביר קלטים ישירות ל־CUDA.

להרצה בפועל צריך transformers מגרסה 4.48 ומעלה, או בילד של vLLM ישירות מהענף הראשי. אם אתם צריכים רק ממשק לצ'אט ולא מאמנים מודל מאפס, עדיף בהרבה להשתמש בגרסת ה־Instruct המוכנה או לפנות ל־API חיצוני, כי תחזוקה עצמאית של תשתית בגודל 32B יקרה ומורכבת.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/OLMo-2-0325-32B")
print(pipe("שלום"))

הרישיון

המודל והקוד שוחררו תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולשלב אותו במוצרים סגורים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗