GPT
O

open_llama_3b_v2

קוד פתוח

openlm-researchapache-2.02023-07-16

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

שחזור פתוח לחלוטין של מודל לאמה, שמאפשר שימוש מסחרי חופשי בלי המגבלות של מטא. הוא קומפקטי מספיק כדי לרוץ על כרטיס מסך ביתי בסיסי.

  • 2,048טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 12,036הורדות בחודש
  • 160לייקים

מה זה

מדובר בגרסה מוקטנת של ארכיטקטורת לאמה שאומנה מאפס על מאגרי מידע פתוחים בלבד, כולל טקסט מבוסס רשת, קוד מסטארקודר וויקיפדיה. היוצרים שלו לא השתמשו במשקלים המקוריים של מטא, מה שפותר את הבעיה המשפטית של המודל המקורי. גרסה זו, v2, החליפה את תערובת הנתונים של הגרסה הקודמת כדי לשפר ביצועים.

במבחני ביצועים הוא מגיע לממוצע של 0.53, שזה שווה ערך כמעט לחלוטין לגרסת ה־v1 שלו, אך מעט מתחת ל־0.55 של לאמה 7B המקורי. במבחנים כמו piqa הוא מקבל ציון של 0.77, גבוה מ־GPT-J שמחזיק פי שניים פרמטרים. המשמעות בפועל היא יכולת הבנה בסיסית סבירה מאוד לגודל שלו, אבל עדיין מדובר במודל בסיס קטן שלא מתקרב למודלים מודרניים גדולים יותר.

מתאים ל

  • אימון ייעודי על חומרה זולה

    מודל בסיס של 3 מיליארד פרמטרים מתאים לכוונון עדין על משימות ספציפיות בעלות מחשוב נמוכה מאוד.

  • סיווג ויצירת טקסט מקומית

    רץ ישירות על תחנות קצה או מחשבים ניידים ללא צורך בחיבור לרשת או שליחת מידע רגיש החוצה.

  • השלמת קוד בסיסית

    נתוני האימון כוללים את מאגר StarCoder, מה שמאפשר לו להבין מבני תחביר פשוטים בפיתוח תוכנה.

איפה זה נופל

חלון ההקשר קצר מאוד ועומד על 2,048 טוקנים בלבד, מה שפוסל אותו לעיבוד מסמכים ארוכים. היוצרים הסירו שני מבחנים מההערכה הרשמית עקב חשד ממשי לזיהום של נתוני האימון עם נתוני המבחן. בנוסף, הטוקנייזר המהיר של Hugging Face מייצר טוקניזציה שגויה שדורשת מעקף ידני בקוד, וחשוב לזכור שזהו מודל בסיס שלא עבר התאמה לשיחה או הנחיות.

אותה משפחה

open-llama יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה הטוקנייזר המהיר עושה בעיות?

היוצרים גילו שההמרה האוטומטית לטוקנייזר המהיר מייצרת פלט שגוי. הפתרון הוא לעבוד ישירות עם LlamaTokenizer או להעביר את הדגל use_fast=False בזמן הטעינה.

האם המודל הזה מבין עברית?

האימון התבסס בעיקר על אנגלית ומאגרי קוד, ללא דגש על שפות שאינן לטיניות. הוא לא יפיק עברית טובה ללא כוונון ייעודי מראש.

האם אפשר להשתמש בו כצ'אטבוט מהקופסה?

לא. מדובר במודל שרק מנחש את הטוקן הבא ולא עבר אימון למענה על הוראות. כדי לדבר איתו צריך לבצע עליו כוונון נוסף של instruction tuning.

איך מריצים

המשקל הכולל של הקבצים הוא 6.4 גיגהבייט בדיוק של float16, כך שכרטיס מסך בודד עם 8 גיגה זיכרון מריץ אותו בלי להזיע. הטעינה נעשית ישירות דרך ספריית transformers בפייתון או דרך תשתית EasyLM ב־JAX, אבל חייבים להגדיר use_fast=False בטוקנייזר בגלל באג ידוע בהמרה האוטומטית.

אם אתם צריכים רק בדיקת היתכנות מהירה או מענה מורכב בעברית, עדיף לפנות ל־API חיצוני. הרצה עצמית של המודל הזה שווה את המאמץ רק כשחייבים פרטיות מלאה של המידע, עבודה בלי רשת, או בסיס קל לאימון עצמי.

from transformers import pipeline

pipe = pipeline("text-generation", model="openlm-research/open_llama_3b_v2")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 6.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו למוצרים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם במערכות סגורות, ללא תשלום תמלוגים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗