GPT
A

Amber

קוד פתוח

IFMapache-2.02023-12-07

  • transformers
  • safetensors
  • llama
  • text-generation
  • nlp

זה מודל שפה פתוח לחלוטין בארכיטקטורת LLaMA עם 360 נקודות ביקורת לאורך כל תהליך האימון. מי שיוריד אותו מחפש בעיקר לחקור איך מודל לומד ולא לקבל תשובות חכמות.

  • 6.7Bפרמטרים
  • 2,048טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 1,866הורדות בחודש

מה זה

המודל מבוסס על מבנה של LLaMA-7B עם כמעט 6.7 מיליארד פרמטרים ומיועד לאנגלית בלבד. הוא אומן על כ־1.26 טריליון טוקנים ממקורות מגוונים כמו Refined-Web, סטארקודר, C4 וספרים, ופורסם במסגרת פרויקט LLM360 שמשתף את כל נתוני האימון, הקוד והמשקלים לכל אורך הדרך.

המפתחים כותבים בעצמם שהמודל אינו בחזית הביצועים. המדדים משקפים את זה בבירור, עם תוצאה של 28.53 ב־MMLU ו־42.57 ב־ARC-C, שזה נמוך מאוד ומצביע על הבנה כללית חלשה של שאלות מורכבות או ידע אקדמי. הייחוד כאן הוא השקיפות המלאה שמאפשרת לבדוק בדיוק איך כל שלב באימון השפיע על היכולות.

מתאים ל

  • מחקר על תהליכי אימון

    360 נקודות ביקורת זמינות מאפשרות לבדוק בדיוק מתי המודל רוכש ידע או דפוסים מסוימים.

  • בסיס לכיוונון עדין אקדמי

    הקוד והמידע הגולמי פתוחים לחלוטין, מה שמתאים למי שרוצה לשחזר ניסויים מבוקרים.

  • בדיקת כלי הערכה ואנליזה

    מודל 7B סטנדרטי בלי הפתעות בארכיטקטורה, שנוח להריץ עליו סקריפטים וסימולציות.

איפה זה נופל

המודל מוגבל לרצף קצר מאוד של 2,048 טוקנים, מה שלא מתאים לעבודה עם מסמכים ארוכים או הקשרים רחבים. מעבר לכך, הוא הוגדר ואומן על אנגלית בלבד ולכן אין מה לבנות עליו לפרויקטים בעברית.

הבעיה העיקרית היא איכות הפלט, והמפתחים מציינים במפורש שהוא אינו SOTA. עם ציון MMLU שקרוב לניחוש אקראי, לא מומלץ לשלב אותו במוצר אמיתי בלי אימון ייעודי ובדיקות קפדניות של ההזיות שלו.

שאלות
נפוצות

האם כדאי להשתמש בו עבור אפליקציה שמייצרת תוכן ללקוחות?

לא. התוצאות במבחנים מראות ביצועים חלשים יחסית למודלים מודרניים בגודל 7B, והוא מוגדר מראש ככלי למחקר ולא לשימוש סופי.

איך ניגשים לגרסאות השונות של שלבי האימון?

אפשר להוריד כל נקודה מ־ckpt_000 עד ckpt_358 ישירות על ידי העברת פרמטר revision בטעינה של transformers מקוד הפייתון.

האם הוא מבין או מייצר עברית בצורה סבירה?

הכרטיס מגדיר אותו באנגלית בלבד, וכל מאגר הנתונים שנחשף מורכב ממקורות באנגלית ובקוד. עברית לא נתמכת כאן באופן רשמי.

איך מריצים

כדי להריץ אותו בפורמט bfloat16 תצטרכו כרטיס מסך עם לפחות 16 ג'יגה זיכרון, שכן המשקלים לבדם תופסים 12.6 ג'יגה. אפשר לטעון אותו ישירות דרך ספריית transformers הרגילה, וברירת המחדל תטען את הגרסה הסופית, ckpt_359. אם רוצים לחקור שלב ביניים מסוים, מעבירים את שם ה־revision הרצוי בהורדה.

אם המטרה שלכם היא להשתמש במודל לטקסט מעשי או ייצור תוכן באפליקציה, חבל על המאמץ והחומרה שלכם. עדיף לקחת מודל מודרני יותר או לשלם סנטים בודדים ל־API של ספק ענן, כי המודל הזה פשוט יפיק תוצאות פחות טובות.

from transformers import pipeline

pipe = pipeline("text-generation", model="IFM/Amber")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר ברישיון apache-2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לבצע עליו אימון נוסף ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗