GPT
O

OLMo-7B

קוד פתוח

allenaiapache-2.02024-01-09

  • transformers
  • pytorch
  • safetensors
  • hf_olmo
  • text-generation

זהו מודל בסיס פתוח לחלוטין באנגלית, שנועד למחקר שדורש גישה מלאה לנתוני האימון ולנקודות הביקורת שלו. הוא מתאים למי שרוצה לנתח את תהליך הלמידה ולא רק לקבל טקסט מוכן.

  • 6.9Bפרמטרים
  • 51.3 GBמשקל הקבצים
  • 4,768הורדות בחודש
  • 653לייקים

מה זה

המודל אומן על מאגר Dolma בהיקף של 2.5 טריליון טוקנים, והוא מייצר טקסט באנגלית בארכיטקטורת רשת של 32 שכבות. הייחוד העיקרי שלו אינו פריצת דרך בביצועים, אלא השקיפות המלאה סביבו, כולל שחרור הקוד, הלוגים, ונקודות בדיקה שנשמרו לאורך כל הריצה בכל אלף צעדים.

במבחני ביצועים הוא עומד בממוצע הכללי על 59.8 נקודות, נתון דומה מאוד ל־Llama 2 7B שמציג 59.3. עם זאת, במבחן MMLU שבודק ידע רחב הוא השיג 28.3 בלבד לעומת 45 של המודל מבית מטא, מה שמראה שהבנת מושגים מורכבים חלשה בו משמעותית ביחס למתחרים הישירים מאותו הגודל.

מתאים ל

  • מחקר על התכנסות מודלים

    שחרור צ'קפוינט בכל 1000 צעדים מאפשר לבדוק שינויים ביכולות לאורך זמן.

  • אימון מודל מותאם מאפס

    הקוד, הנתונים ומתכוני האימון פתוחים לגמרי ומאפשרים שחזור מלא.

  • השלמת טקסט באנגלית

    מתאים למשימות בסיסיות של חיזוי טקסט שאינן דורשות שיחה או מענה להוראות.

איפה זה נופל

זהו מודל בסיס שלא עבר אימון להוראות או סינון בטיחות, ולכן קל לגרום לו לייצר מידע מוטעה או תוכן פוגעני. לפי כרטיס המודל, עובדות רבות שהוא מייצר אינן נכונות ודורשות אימות. הוא תומך באנגלית בלבד, כך שהוא לא מתאים לעבודה בעברית, וחלון ההקשר שלו מוגבל ל־2,048 טוקנים, שזה מעט מאוד ביחס לסטנדרט הנוכחי. בנוסף, תוצאות ה־MMLU וה־GSM8k הנמוכות מעידות על חולשה מהותית בהיגיון מתמטי ופתרון בעיות.

אותה משפחה

OLMo יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש במודל הזה עבור צ'אטבוט?

לא. זהו מודל בסיס שלא עבר כוונון לשיחה או מילוי הוראות, ולכן הוא פשוט ימשיך את הטקסט שתזינו לו במקום לענות לשאלות. כדי לבנות צ'אטבוט תצטרכו להשתמש במודל שעבר שלב של אימון הנחיות, כמו פרויקט open-instruct של המפתחים.

האם המודל מבין או כותב עברית?

לא, המודל אומן על מאגר Dolma שכולל אנגלית בלבד. ניסיון להזין לו פרומפטים בעברית יוביל לפלט משובש ולא עקבי, כך שהוא אינו מתאים למוצרים המיועדים לשוק הישראלי.

מה ההבדל בין המשקלים כאן לבין OLMo-7B-hf?

הגרסה המקורית דורשת ספרייה חיצונית בשם ai2-olmo כדי לפעול דרך פייתון. גרסת ה־hf הותאמה כדי לעבוד בצורה נקייה וטבעית יותר עם ספריית transformers מגרסה 4.40.0 ומעלה, ומומלץ להשתמש בה אם אתם מתבססים על סביבה עדכנית.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית ai2-olmo הייעודית, או לעבוד עם גרסת ה־HF אם אתם בסביבת transformers מגרסה 4.40.0 ומעלה. המשקל הכולל של הקבצים מגיע ל־51.3 גיגה בייט, כך שתצטרכו כרטיס מסך חזק עם מספיק זיכרון VRAM, לפחות 16 עד 24 גיגה בייט להרצה בסיסית, או להשתמש בקוונטיזציה של 8 ביט עם bitsandbytes כדי לחסוך מקום.

אם אתם לא צריכים גרסאות ביניים היסטוריות כדי לחקור את ההתנהגות שלו או לאמן אותו מחדש מאפס, החזקת חומרה ייעודית בשבילו תהיה יקרה ומיותרת. במקרה של צורך פשוט ביצירת טקסט, עדיף לפנות ל־API מסחרי מוכן.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/OLMo-7B")
print(pipe("שלום"))

הרישיון

המודל והקוד שלו מופצים תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב בתוך מוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים ומתן קרדיט למפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗