GPT
O

open_llama_7b

קוד פתוח

openlm-researchapache-2.02023-06-07

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

שחזור פתוח לחלוטין של מודל LLaMA המקורי, שאומן מאפס על טריליון טוקנים. הוא פותר את בעיית הרישיון המגביל של מטא ומאפשר שימוש מסחרי חופשי.

  • 2,048טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 79,657הורדות בחודש
  • 139לייקים

מה זה

הפרויקט הזה מציע משקלים של מודל שפה שנבנה בדיוק לפי הארכיטקטורה וההיפר-פרמטרים של מטא, אבל אומן על דאטה-סט חלופי בשם RedPajama. המטרה כאן ברורה, לתת חלופה ישירה של 7 מיליארד פרמטרים בלי התלות המשפטית או המגבלות של מטא.

במבחני ביצועים מול המקור ומול GPT-J, הוא עומד בכבוד. הממוצע הכללי שלו עומד על 0.55 לעומת 0.53 של LLaMA המקורי. בחלק מהמשימות, כמו arc_easy שבו הגיע לציון 0.72 לעומת 0.68, הוא אפילו מציג יתרון קל. הוא לא מודל שיחה שמוכן לעבודה עם משתמשי קצה, אלא מודל בסיס להמשך אימון והשלמת טקסט.

מתאים ל

  • אימון מודל מותאם אישית

    בסיס נקי ויציב להרצת fine-tuning לשימושים עסקיים תחת רישיון פתוח לחלוטין.

  • השלמת טקסט בתוך מערכת

    מתאים למשימות קצרות ומובנות שלא דורשות חלון הקשר ארוך מעבר ל־2,048 טוקנים.

  • החלפת LLaMA מקורי במוצר

    מאפשר להיפטר מהסיבוך המשפטי של משקלי מטא בלי לשנות את הארכיטקטורה בקוד.

איפה זה נופל

המודל הזה הוא מודל בסיס בלבד ולא עבר כוונון להוראות, כך שהוא ינסה להשלים טקסט ולא לנהל שיחה קוהרנטית בלי אימון נוסף. חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, מה שמקשה על עבודה עם מסמכים ארוכים.

בנוסף, המפתחים הודו במפורש שהם נאלצו להסיר שני מבחנים מההשוואות שלהם, CB ו־WSC, בגלל חשד לזיהום נתונים שגרם למודל להציג תוצאות חשודות. מעבר לזה, המודל אומן על דאטה כללי באנגלית ואין שום התייחסות לביצועים בעברית בכרטיס.

אותה משפחה

open-llama יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה שהמודל יחזיר טוקנים שגויים בריצה רגילה?

היוצרים גילו שה־fast tokenizer האוטומטי בספריית transformers משבש את הטוקניזציה. כדי לעקוף את זה חובה להשתמש ב־LlamaTokenizer או להעביר את הפרמטר use_fast=False בזמן הטעינה.

האם הוא מבין עברית?

אין בכרטיס המודל שום מידע על תמיכה בעברית. הוא אומן על מאגר RedPajama שמבוסס בעיקר על תוכן באנגלית, ולכן סביר להניח שהביצועים בעברית יהיו נמוכים מאוד ללא אימון נוסף.

איך מריצים

המשקלים תופסים 12.6 גיגה-בייט ומגיעים בפורמט float16, מה שאומר שכרטיס מסך עם 16 גיגה-בייט זיכרון יספיק כדי להריץ אותו מקומית. אפשר לטעון אותו ישירות דרך ספריית transformers הרגילה או בעזרת EasyLM אם אתם עובדים בסביבת JAX ו־TPU.

נקודה טכנית קריטית היא מנתח הטוקנים. היוצרים מזהירים משימוש בגרסה המהירה של ה־tokenizer בגלל באג שמייצר המרות שגויות, ולכן צריך להגדיר שימוש ב־LlamaTokenizer או להעביר דגל מתאים. אם אתם צריכים רק מענה מהיר ואין לכם כרטיס מתאים בשרת, להרים אותו עצמאית ידרוש התעסקות מיותרת ביחס לקריאת API.

from transformers import pipeline

pipe = pipeline("text-generation", model="openlm-research/open_llama_7b")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר ברישיון Apache 2.0 מלא, גם למשקלים וגם לקוד האימון. זה אומר שמותר להשתמש בו למוצרים מסחריים, לשנות אותו, לאמן אותו מחדש ולהפיץ אותו בלי לשלם תמלוגים, כל עוד שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗