GPT
L

llama-7b-hf

קוד פתוח

yahmaother2023-04-08

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

ההמרה הזו של LLaMA המקורית מתאימה ישירות לספריית transformers. מי שרוצה משקלים מוכנים של מודל הבסיס הראשון של מטא בלי להתעסק בהמרות ידניות ימצא אותם כאן.

  • 12.6 GBמשקל הקבצים
  • 9,979הורדות בחודש
  • 89לייקים
  • 32שכבות

מה זה

מטא אימנה את מודל הבסיס הזה על טריליון טוקנים שנאספו בעיקר מדפי אינטרנט, גיטהאב ומאמרים מדעיים. yahma לקח את הגרסה של שבעה מיליארד פרמטרים והמיר את המשקלים למבנה שספריית transformers של HuggingFace יודעת לקרוא ישירות, לצד תיקון בעיות בטוקן הסיום שהיו בגרסאות מוקדמות יותר.

במדדי היגיון והבנה כללית הוא מציג מספרים סבירים לגודל שלו, כמו 76.5 בבדיקת BoolQ או 76.1 ב־HellaSwag, אבל נחלש מאוד במשימות מורכבות יותר כמו ARC Challenge שבו קיבל 47.6. הוא לא עבר התאמה לשיחה ולא כוונן על הוראות אנושיות, ולכן פועל רק כממשיך טקסט הסתברותי.

רוב המידע שממנו למד כתוב באנגלית. יש בנתונים עשרים שפות נוספות, אבל עברית כלל לא מופיעה ברשימת השפות של מערכי המקור, כך שאין מה לבנות עליו לפעולות בעברית.

מתאים ל

  • מחקר על מודלי שפה

    ניתוח ארכיטקטורת הבסיס של מטא ובדיקת הטיות בתוצרי אימון גולמיים ללא התערבות אנושית.

  • בדיקת המרות תוכנה

    שילוב מהיר בסביבות פיתוח מבוססות transformers למי שצריך לבדוק תאימות קוד ל־LLaMA.

  • אימון מודלים מותאמים

    נקודת מוצא לכוונון עצמאי על דאטה ייעודי באנגלית במסגרת אקדמית או מחקרית בלבד.

איפה זה נופל

זהו מודל בסיס ללא אימון מבוסס משוב אנושי, מה שאומר שהוא מייצר הזיות, ממציא עובדות ועלול לפלוט תוכן פוגעני או רעיל בקלות. לפי הכרטיס, הוא נשען על מידע שנאסף מהרשת ולכן מציג הטיות מובנות בנושאי מגדר, דת ונטייה מינית. בנוסף, עברית לא נכללת בעשרים השפות שצוינו במפורש במאגר האימון שלו, ולכן הוא לא מתאים לעיבוד טקסט מקומי.

שאלות
נפוצות

האם המודל הזה יענה לי כמו צ'אטבוט?

לא. מדובר במודל שרק משלים טקסט ולא עבר יישור מול הנחיות של בני אדם. אם תשאלו אותו שאלה, הוא עשוי להמציא המשך למשפט או לייצר שאלות נוספות במקום לענות.

האם יש לו תמיכה מלאה בשפה העברית?

לא. רשימת השפות שפורסמה בכרטיס המודל כוללת עשרים שפות בלבד ועברית לא ביניהן. הוא אומן ברובו המוחלט על אנגלית וביצועיו בשפות אחרות מוגבלים מאוד.

איך מריצים

המשקלים תופסים 12.6 ג'יגה־בייט בזיכרון בדיוק float16. כדי לטעון אותו ולהריץ הסקה תצטרכו כרטיס מסך עם לפחות 16 ג'יגה־בייט של VRAM, כמו RTX 4080 או כרטיס שרת מקביל. אם המטרה היא כוונון עדין מקומי, הדרישות יקפצו במהירות ותצטרכו חומרה חזקה בהרבה או שימוש בשיטות כמו LoRA כדי לא לחנוק את המעבד הגרפי.

ההרצה מתבצעת ישירות דרך transformers בעזרת המחלקה LlamaForCausalLM. אם אין לכם שרת ייעודי או כרטיס מסך מתאים, אין סיבה להסתבך עם התקנה מקומית. עדיף לפנות למודלים מודרניים יותר שמוגשים דרך ספקי ענן ונותנים גישה פשוטה ב־API לפי שימוש, במיוחד כשיש חלופות עדכניות בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="yahma/llama-7b-hf")
print(pipe("שלום"))

הרישיון

הרישיון כאן מוגדר כחריג ולא מסחרי. מטא שחררה את הגרסה הזו לצורכי מחקר בלבד עבור מי שקיבל אישור בטופס ייעודי, והיוצר מבהיר שההורדה מיועדת רק למי שכבר קיבל גישה רשמית. אסור להכניס את המודל הזה למוצר מסחרי פעיל או למכור שירותים שמבוססים עליו.

הרישיון המלא בעמוד המודל ↗