GPT
O

OLMo-1B

קוד פתוח

allenaiapache-2.02024-01-26

  • transformers
  • pytorch
  • safetensors
  • hf_olmo
  • text-generation

זה מודל שפה פתוח לחלוטין של 1.2 מיליארד פרמטרים. מי שיבחר בו מחפש שקיפות מלאה לצורכי מחקר, כולל גישה לכל צעד באימון ולנתוני המקור.

  • 1.2Bפרמטרים
  • 8.8 GBמשקל הקבצים
  • 2,021הורדות בחודש
  • 108לייקים

מה זה

מדובר במודל יוצר טקסט באנגלית שאומן על 3 טריליון טוקנים מתוך מאגר המידע Dolma. בניגוד לרוב המודלים שמשחררים רק משקלים סופיים, כאן פתחו את כל הקוד, נתוני האימון ונקודות הביקורת לאורך הדרך. הוא מגיע עם 16 שכבות וחלון הקשר של 2048 טוקנים.

במדדי ההערכה מול גדלים דומים, הוא מציג ביצועים סבירים אך לא אחידים. בממוצע משימות הליבה הוא עומד על ציון 62.42, שזה טוב יותר מ־Pythia 1B שקיבל 56.44 ומ־TinyLlama שקיבל 61.48. עם זאת, StableLM 2 1.6b עוקף אותו בקלות עם 68.41, כך שביצועים נטו אינם נקודת החוזק היחידה פה אלא השקיפות סביב הנתונים.

מתאים ל

  • מחקר על תהליכי אימון

    זמינות נקודות הביקורת כל 1000 צעדים מאפשרת לעקוב אחרי למידת השפה בזמן אמת.

  • כוונון עדין למשימות ממוקדות

    משקל קל וקוד פתוח מלא מאפשרים אימון המשך מהיר באנגלית על חומרה צנועה יחסית.

  • הערכת השפעת נתוני מקור

    החשיפה המלאה של מאגר Dolma מאפשרת לבודד בדיוק אילו טקסטים יצרו תופעות מסוימות.

איפה זה נופל

זה מודל בסיס ללא התאמת הנחיות או מנגנוני בטיחות. המפתחים מבהירים שקל מאוד לגרום לו לפלוט מידע שגוי, תוכן פוגעני והטיות שנאספו ברשת, כך שאסור לחבר אותו ישירות למשתמשי קצה בלי שכבת סינון ובדיקת עובדות. בנוסף, הוא אומן על אנגלית בלבד עם חיתוך מידע סביב תחילת 2023, ועברית אינה נתמכת.

אותה משפחה

OLMo יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין או מייצר עברית?

לא. המודל הוגדר ואומן על טקסטים באנגלית בלבד. כל ניסיון לעבוד איתו בעברית יפיק פלט משובש או חסר משמעות.

למה יש שגיאת ייבוא כשמנסים להריץ אותו רגיל בטרנספורמרס?

הארכיטקטורה שלו דורשת התקנה נפרדת של הספרייה ai2-olmo בסביבת העבודה. בנוסף, מפתחי המודל ממליצים למי שמשתמש בגרסאות transformers מודרניות מ־v4.40.0 ומעלה לעבור למשקלים המותאמים תחת השם OLMo-1B-hf.

איך מריצים

כדי להריץ אותו צריך להתקין את החבילה הייעודית ai2-olmo לצד transformers, שכן בלעדיה הקריאה תיכשל. משקל הקבצים עומד על 8.8 גיגה בייט, כך שהוא ירוץ בלי בעיה על מעבד גרפי ביתי פשוט, ועם קוונטיזציה ל־8 ביט אפשר להוריד את צריכת הזיכרון עוד יותר.

אם כל מה שאתם צריכים זה תשובות לשאלות או סתם השלמת טקסט, עדיף לפנות ל־API חיצוני של מודל ענן חזק. המאמץ להריץ ולכוונן את המודל הזה מתאים בעיקר למי שרוצה לבדוק התנהגות פנימית של מודלים או לבצע אימון המשך על חומרה מקומית בתקציב נמוך.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/OLMo-1B")
print(pipe("שלום"))

הרישיון

המודל והקוד שוחררו תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב במוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗