GPT
L

llama-13b

קוד פתוח

huggyllamaother2023-04-03

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

הורדה ישירה של משקלי LLaMA המקוריים בפורמט שמתאים ישר לתוך transformers. מתאים למי שקיבל אישור ממטא ורוצה לדלג על שלב ההמרה הידני.

  • 13Bפרמטרים
  • 2,048טוקנים בהקשר
  • 48.5 GBמשקל הקבצים
  • 2,068הורדות בחודש

מה זה

מדובר במשקלי הבסיס של מודל ה 13B המקורי של מטא, ארוזים מראש לקבצי safetensors ומשקלים שנטענים ישירות בספריית transformers. המשתמש huggyllama העלה את זה כדי לחסוך את כאב הראש של המרת הקבצים המקוריים של מטא לפורמט של Hugging Face, במיוחד למי שאיבד את העותק שהמיר בעצמו.

הוא מיועד ליצירת טקסט בסיסית וכולל 40 שכבות בדיוק float16. אין כאן כוונון עדין להוראות או לצ'אט, אלא מודל גולמי שמשלים טקסט. מי שמחפש עוזר שמתנהג כמו צ'אטבוט יצטרך לאמן אותו בעצמו או לחפש גרסה שעברה אימון כזה.

מתאים ל

  • אימון והתאמה אישית

    בסיס גולמי של 13 מיליארד פרמטרים שמתאים למי שרוצה לאמן מודל פנימי על דאטה ייעודי.

  • מחקר אקדמי מקומי

    בדיקת התנהגות של מודלי שפה בלי תלות ברשת ועל משקלי הבסיס המקוריים של מטא.

  • החלפת קבצים שאבדו

    שחזור מהיר של המשקלים בפורמט של transformers למי שקיבל גישה רשמית ממטא.

איפה זה נופל

זה מודל בסיס ישן יחסית מאפריל 2023 עם חלון הקשר קצרצר של 2,048 טוקנים בלבד. הוא לא עבר fine-tuning להנחיות, מה שאומר שהוא בעיקר מנחש את המילה הבאה ולא בהכרח עונה לשאלות ישירות. אסור להכניס אותו כפי שהוא למוצר מול לקוחות בלי תהליך התאמה רציני.

אותה משפחה

llama יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לפיתוח מוצר מסחרי?

לא. הרישיון של מטא למשקלים האלה אינו מסחרי, ובעמוד המודל מצוין בפירוש שהוא תחת non-commercial license. לשימוש מסחרי תצטרכו להסתכל על גרסאות חדשות יותר או ארכיטקטורות חופשיות.

למה להוריד את הגרסה הזו ולא ישר ממטא?

הקבצים שמטא חילקה במקור דרשו הרצה של סקריפט המרה מיוחד כדי להתאים אותם לעבודה עם transformers. המאגר הזה מכיל את המשקלים כשהם כבר מומרים ומוכנים לטעינה בקוד.

איך מריצים

הקבצים שוקלים 48.5 גיגה בייט, מה שאומר שצריך כרטיס מסך עם זיכרון משמעותי כדי לטעון אותו במלואו, לפחות 32 גיגה בייט של VRAM להרצה חלקה ב float16, או שימוש בקוונטיזציה לחומרה ביתית. מריצים אותו ישירות עם transformers בעזרת LlamaForCausalLM.

אם אין לכם שרת ייעודי עם חומרה מתאימה, ההורדה וההחזקה שלו בזיכרון מקומי פשוט יקרות מדי ביחס לתוצאה, ועדיף להשתמש במודלים מודרניים יותר דרך ממשקי API.

from transformers import pipeline

pipe = pipeline("text-generation", model="huggyllama/llama-13b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר בתור other ומיועד לשימוש לא מסחרי בלבד. המפרסם מבהיר במפורש שהמאגר נועד רק למי שכבר מילא את הטופס של מטא וקיבל גישה רשמית למשקלים. אי אפשר להשתמש בזה במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗