GPT
L

llama-2-7b-chat-hf

קוד פתוח

daryl149רישיון לא דווח2023-07-18

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

הורדה ישירה של משקלי Llama 2 בגודל שבעה מיליארד פרמטרים מותאמים לשיחה. הפצה לא רשמית של משתמש עצמאי שהמיר את הקבצים המקוריים למבנה של Hugging Face.

  • 2,048טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 682הורדות בחודש
  • 122לייקים

מה זה

המאגר מכיל המרה של מודל השיחה מבית מטא לפורמט שנטען ישירות בספריית transformers. המפרסם daryl149 העלה את הקבצים ביולי 2023, ביום ההכרזה המקורי של מטא, כדי לעקוף את תהליך ההרשמה וההמתנה הרשמי ולקבל משקלים שמוכנים מיידית לעבודה בקוד.

בפנים נמצא המודל בגודל שבעה מיליארד פרמטרים שעבר fine tuning לשיחה וליצירת טקסט. המבנה כולל שלושים ושתיים שכבות וחלון הקשר של 2,048 טוקנים, ללא נתוני מדידה או מבחני ביצועים נוספים בתיעוד. החבילה מספקת בדיוק את המשקלים של מטא בפורמט פתוח, ללא אימון נוסף או שינוי בארכיטקטורה.

מתאים ל

  • בוט שיחה עצמאי

    מתאים לשיחות קצרות ומענה ישיר בסביבה פרטית שבה שומרים על המשקלים בשרת מקומי.

  • יצירת טקסט מקומית

    מייצר טקסט ורפליקות בדיוק סביר ישירות דרך ספריית transformers בלי תלות באינטרנט.

  • בדיקות פיתוח מהירות

    מאפשר לבדוק אינטגרציות קוד עם Llama 2 בלי להירשם בטפסים של מטא.

איפה זה נופל

החיסרון המרכזי הוא חלון הקשר של 2,048 טוקנים בלבד. המגבלה הזו מקשה על ניתוח מסמכים ארוכים או שיחות מתמשכות. בנוסף, מדובר בהעלאה מצד שלישי שלא מעודכנת ולא מנוהלת רשמית על ידי מטא, ולכן חסר כל תיעוד על התנהגות מיוחדת או בדיקות בטיחות שנעשו בהמרה.

שאלות
נפוצות

למה להוריד את המאגר הזה ולא את הרשמי של מטא?

המאגר הזה עלה כשהגישה הרשמית דרשה אישור ידני וטפסים אצל מטא. כיום מדובר פשוט בהמרה ישנה שזמינה להורדה ישירה ללא הרשמה מוקדמת, אבל אין בה יתרון טכני על פני המקור.

האם המודל ירוץ על כרטיס מסך ביתי רגיל?

המשקל הכולל מגיע ל 12.6 ג'יגה בייט בדיוק float16, ולכן דרוש כרטיס מסך עם לפחות שישה עשר ג'יגה בייט זיכרון כדי לטעון אותו ללא קוונטיזציה. על כרטיסים פשוטים יותר המודל לא ייכנס לזיכרון הגרפי בלי דחיסה.

איך מריצים

כדי להריץ את המודל בדיוק float16 מלא צריך להוריד 12.6 ג'יגה בייט ולטעון אותם לזיכרון של כרטיס מסך עם לפחות שישה עשר ג'יגה בייט VRAM. המודל מחולק לאחד עשר קבצים ונטען ישירות דרך ספריית transformers של פייתון בלי צורך בהמרות נוספות.

אם אין לכם חומרה ייעודית עם מספיק זיכרון גרפי, לא שווה להריץ אותו מקומית. עדיף לפנות לנקודת קצה מנוהלת או שירות ענן שמספקים גישה לגרסה הזו בתשלום לפי קריאה, במקום להחזיק שרת יקר בשביל חלון הקשר קצר כל כך.

from transformers import pipeline

pipe = pipeline("text-generation", model="daryl149/llama-2-7b-chat-hf")
print(pipe("שלום"))

הרישיון

המודל כולל בטקסט את הסכם הרישיון המקורי של מטא, Llama 2 Community License, אף שבמטאדטה של הדף הרישיון מוגדר כלא דווח. הרישיון מתיר שימוש מסחרי חופשי כל עוד אין לכם מעל שבע מאות מיליון משתמשים פעילים בחודש, ואתם שומרים על תנאי השימוש וייחוס הזכויות.

הרישיון המלא בעמוד המודל ↗