GPT
L

llama-30b

קוד פתוח

huggyllamaother2023-04-04

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

העלאה קהילתית שמנגישה משקולות מוכנות לשימוש בפורמט transformers. זה פתרון למי שקיבל גישה רשמית למודל ונתקע בהמרת הקבצים לעבודה ישירה.

  • 33Bפרמטרים
  • 121 GBמשקל הקבצים
  • 2,117הורדות בחודש
  • 48לייקים

מה זה

מדובר במודל גולמי ליצירת טקסט של כ־33 מיליארד פרמטרים, בארכיטקטורת LlamaForCausalLM עם 60 שכבות ובדיוק float16. המאגר עצמו לא מאמן שום דבר מחדש ולא מוסיף כוונון להוראות, אלא מחזיק המרה מוכנה של המשקולות המקוריות כדי לחסוך עבודה ידנית.

בגודל הזה הוא נועד לתת מענה רחב יותר ממודלי בסיס קטנים של 7 או 13 מיליארד, אבל הוא עדיין מודל בסיס לכל דבר. הוא לא עבר fine-tuning לשיחה, ולכן הוא ממשיך טקסטים ולא עונה כעוזר אישי אלא אם מכוונים אותו או בונים סביבו פרומפטים מתאימים.

מתאים ל

  • מחקר על מודלי שפה

    טוב לבדיקות של מודל בסיס בגודל ביניים של 60 שכבות בלי להתעסק בהמרת משקולות לבד.

  • אימון והתאמה אישית

    מתאים כבסיס ל־fine-tuning על נתונים פרטיים אם יש לכם את כוח העיבוד המתאים.

  • השלמת טקסט חופשי

    עובד ביצירת המשכים לפסקאות או קטעי קוד כשמספקים לו התחלה ברורה.

איפה זה נופל

המודל מגיע כממשיך טקסט בלבד ולא מותאם לצ'אט או למילוי הוראות מדויקות מהקופסה. מעבר לזה, הכרטיס מבהיר שזה מאגר שנועד למי שכבר קיבל אישור רשמי דרך טופס הבקשה של יוצרי המקור ונתקל בבעיות המרה, כך שאין כאן תמיכה מסודרת, תיעוד ביצועים או התחייבות לתקינות מעבר לקבצים עצמם.

אותה משפחה

llama יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מוכן לשיחה בסגנון צ'אט?

לא, זה מודל בסיס מסוג causal LM שלא אומן להחזיר תשובות לשאלות. הוא פשוט מנחש את המילים הבאות ברצף, וכדי לקבל ממנו דיאלוג תצטרכו לאמן אותו או להנדס פרומפט בהתאם.

מה היתרון במאגר הזה על פני הקבצים הרשמיים?

הוא חוסך את תהליך ההמרה לפורמט של ספריית transformers. מי שקיבל אישור גישה אך התקשה לבצע את ההמרה הטכנית מקבל כאן קבצים שנטענים ישירות בקוד.

איך מריצים

כדי להריץ אותו מקומית צריך להתמודד עם הורדה של 121 גיגה בייט המחולקים ל־25 קבצים. זה דורש מערך של כמה כרטיסי מסך חזקים או שרת ייעודי עם מספיק זיכרון VRAM כדי לטעון 60 שכבות בדיוק של float16.

אם אין לכם תשתית כבדה כזו זמינה פיזית או בענן, מורכב ויקר להחזיק אותו באוויר רק כדי לבדוק משהו. במקרים כאלה עדיף לפנות לפתרונות מנוהלים או ל־API חיצוני במקום לקנות חומרה ייעודית.

from transformers import pipeline

pipe = pipeline("text-generation", model="huggyllama/llama-30b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other והכרטיס מציין במפורש שהוא לא מסחרי. מותר להשתמש בו רק אם מילאתם את טופס הבקשה הרשמי וקיבלתם גישה. אם אתם בונים מוצר מסחרי, המודל הזה סגור בפניכם לחלוטין.

הרישיון המלא בעמוד המודל ↗