GPT
O

open_llama_3b

קוד פתוח

openlm-researchapache-2.02023-06-07

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

שחזור פתוח לחלוטין של LLaMA המקורית עם רישיון חופשי לשימוש מסחרי. מתאים למי שחייב מודל קל משקל בלי התסבוכות המשפטיות של מטא.

  • 2,048טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 5,383הורדות בחודש
  • 166לייקים

מה זה

המודל הזה נבנה מאפס על בסיס סט הנתונים RedPajama, שמכיל מעל 1.2 טריליון טוקנים ומשחזר את המידע שבו מטא השתמשה. המטרה כאן ברורה: לתת משקלים חופשיים לגמרי בלי תלות בקבצים המקוריים או בהגבלות המחקר של LLaMA 1. הארכיטקטורה עוקבת במדויק אחרי המבנה המקורי, כולל 26 שכבות וחלון הקשר של 2,048 טוקנים.

במבחני הביצועים הוא מציג ממוצע של 0.52 לעומת 0.51 של GPT-J בעל 6 מיליארד הפרמטרים, וקרוב ל־0.53 של LLaMA 7B המקורית. זה אומר שבחצי מכמות הפרמטרים הוא עומד יפה במשימות היגיון כמו PIQA ו־ARC, אם כי משימות מורכבות יותר עדיין חושפות את הגודל הצנוע שלו.

מתאים ל

  • בסיס לכוונון עדין

    נקודת מוצא זולה ומהירה לאימון על משימות ספציפיות בעזרת משקלים פתוחים ברישיון חופשי.

  • סיווג וחילוץ מידע מקומי

    משקל של 6.4 גיגה מאפשר עיבוד טקסטים מהיר על חומרה מקומית ללא עלויות ענן.

  • הטמעה במערכות קצה

    3 מיליארד פרמטרים רצים בנוחות על שרתים פשוטים עם זיכרון גרפי מוגבל.

איפה זה נופל

זהו מודל בסיס לא מכוונן, ללא שלב של הוראות או יישור התנהגותי, כך שאי אפשר לצפות ממנו לנהל שיחה קולחת בלי שתבצעו כוונון עדין למשימה שלכם. מעבר לכך, היוצרים הסירו את המבחנים CB ו־WSC מההערכה הרשמית עקב חשד לזיהום בסט האימון, מה שמעיד שחלק מנתוני הבדיקה נזלו לדאטה. חלון ההקשר מוגבל ל־2,048 טוקנים, מגבלה מורגשת מאוד במסמכים ארוכים.

אותה משפחה

open-llama יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה המודל מחזיר פלט משובש כשטוענים אותו בספרייה?

הטוקנייזר האוטומטי המהיר של Hugging Face יוצר בעיות המרה עם המודל הזה. הפתרון הוא לטעון אותו עם מחלקת LlamaTokenizer המפורשת או להעביר את הדגל use_fast=False בזמן הטעינה.

האם המודל מבין הוראות ומנהל שיחה מהקופסה?

לא. מדובר במודל שמאומן להשלמת טקסט בלבד ולא עבר אימון שיחה. כדי לקבל תוצאות טובות תצטרכו להגדיר לו דוגמאות בתוך הפרומפט, או לאמן עליו שכבת LoRA למשימה מוגדרת.

איך מריצים

המשקל הכולל של הקבצים עומד על 6.4 גיגה־בייט בדיוק של float16, מה שמאפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 8 עד 12 גיגה זיכרון. טוענים אותו ישירות דרך ספריית transformers עם LlamaForCausalLM, או דרך EasyLM ב־JAX אם אתם עובדים על סביבת TPU.

נקודה קריטית בזמן הטעינה: הטוקנייזר המהיר של Hugging Face מייצר שגיאות המרה במודל הזה, ולכן חובה להשתמש ב־LlamaTokenizer הרגיל או להגדיר use_fast=False. אם אתם צריכים רק מענה טקסטואלי מזדמן ולא מחזיקים חומרה מתאימה, שירות ענן חיצוני יהיה פשוט וזול יותר מתחזוקת שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="openlm-research/open_llama_3b")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 6.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והמשקלים שוחררו תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי הקוד והפצה של המודל בתוך מוצרים סגורים, בלי לשלם תמלוגים ובלי לחשוף את הקוד שלכם. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗