GPT
O

OLMo-2-1124-13B

קוד פתוח

allenaiapache-2.02024-11-19

  • safetensors
  • olmo2
  • en

זה מודל בסיס פתוח לחלוטין שמציג את כל נתוני האימון והמשקלים. הוא מיועד למי שחייב שקיפות מלאה ויכולת לאמן מודל מאפס או לשנות שלבי אימון בעצמו.

  • 14Bפרמטרים
  • 4,096טוקנים בהקשר
  • 51.1 GBמשקל הקבצים
  • 11,874הורדות בחודש

מה זה

מכון אלן שחרר את המודל הזה כחלק ממשפחת מודלים פתוחה, כשהייחוד שלו הוא גישה מלאה לקוד, לנתוני האימון ממאגר Dolma ולנקודות ביקורת לאורך הדרך. הוא אומן על 5 טריליון טוקנים בשלב הראשון, עבר שלב שני עם תערובות נתונים שונות, ואז מוזג לכדי משקל סופי. מדובר במודל בסיס שמשלים טקסט, לא בצ'אטבוט שמגיב להוראות ישר מהקופסה.

במבחנים האקדמיים באנגלית הוא משיג ממוצע של 68.3 נקודות, מה שמציב אותו מעל Llama 2 13B הישן יותר ומעל מודלים פתוחים מלאים קודמים. הוא מתקרב לביצועים של Mistral Nemo 12B שעומד על 66.9 ו־Gemma 2 9B שמגיע ל־67.8, אבל עדיין מפגר מאחורי Qwen 2.5 14B שמחזיק בממוצע של 72.2. המודל מתבלט במיוחד במבחני הבנת הנקרא כמו DROP עם ציון 70.7, אך במבחני מתמטיקה כמו GSM8k הוא מקבל 75.1 לעומת 83.4 של המתחרה מבית עליבאבא.

מתאים ל

  • מחקר על תהליכי אימון

    גישה חופשית לנקודות ביקורת ונתוני דולמה מאפשרת לחקור שינויים פנימיים לאורך שלבי אימון שונים.

  • אימון מודל ייעודי מאפס

    בסיס נקי ואיכותי באנגלית שעבר 5 טריליון טוקנים, מתאים למי שבונה שכבת SFT ו־DPO עצמאית לחלוטין.

  • משימות השלמת טקסט סגורות

    מתאים להרצה מקומית עבור השלמת משפטים וניתוח טקסטואלי מחקרי שלא דורש שיחה אלא ניבוי סטטיסטי.

איפה זה נופל

המודל תומך רשמית באנגלית בלבד ותאריך היעד של המידע שלו נעצר בדצמבר 2023, כך שכל אירוע מאוחר יותר אינו קיים בו. חלון ההקשר עומד על 4,096 טוקנים, מגבלה משמעותית ביחס לסטנדרטים עכשוויים שמקשה על עיבוד מסמכים ארוכים.

מכיוון שזהו מודל בסיס ללא שכבות כוונון של בטיחות או שיחה, הוא נוטה לפלוט מידע שגוי, לייצר הטיות ולהגיב באופן לא צפוי לפקודות ישירות. אי אפשר לשלב אותו במוצר בלי לבצע קודם אימון ייעודי על הוראות וסינון פלטים.

אותה משפחה

OLMo-2-1124 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות לצ'אט בעברית?

לא. המודל אומן על אנגלית בלבד ומעבר לזה הוא מודל בסיס, מה שאומר שהוא ינסה להמשיך את הטקסט במקום לענות לשאלות. לצורך צ'אט עדיף להוריד את גרסת ה־Instruct שלו או מודל שמאומן מראש על עברית.

האם המודל ירוץ על כרטיס מסך ביתי רגיל?

לא במצבו הרגיל. הקבצים שוקלים מעל 50 גיגה בייט בגלל דיוק float32. רק אחרי כיווץ לקוונטיזציה של 8 ביט תוכלו להריץ אותו, וגם אז תצטרכו כרטיס חזק עם 24 גיגה בייט זיכרון גרפי.

איך מריצים

המשקלים מגיעים בדיוק של float32 ושוקלים 51.1 גיגה בייט, כך שהרצה ישירה במצב הזה דורשת כרטיס מקצועי חזק מאוד כמו A100 או שרשור של מספר כרטיסים. כדי להריץ מקומית על חומרה צנועה יותר תצטרכו להשתמש בקוונטיזציה של 8 ביט דרך bitsandbytes עם float16, מה שמאפשר לדחוף את המודל לכרטיס בודד בעל זיכרון של 24 גיגה בייט לפחות.

המפתח מחייב שימוש בגרסה העדכנית ביותר של ספריית transformers ישירות ממאגר הגיטהאב. אם המטרה היא לקבל תשובות מוכנות למשתמשי קצה בלי צורך במחקר על תהליך האימון, חבל על החומרה והעבודה, ועדיף להשתמש בגרסת ה־Instruct המוכנה או לפנות ל־API מסחרי של מודל מלוטש.

pip install -U huggingface_hub
hf download allenai/OLMo-2-1124-13B

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש חופשי לחלוטין כולל שימוש מסחרי, שינוי הקוד והפצה מחדש. אין תמלוגים ואין הגבלות שימוש סגורות, למעט חובת שמירה על תנאי הרישיון וציון הקרדיט המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗