GPT
L

Llama-2-7b-chat-coreml

קוד פתוח

enterprise-explorersother2023-07-18

  • transformers
  • coreml
  • llama
  • text-generation
  • meta

המרה של לאמה 2 לפורמט Core ML מאפשרת להריץ שיחות מקומית על מכשירי אפל. היא נועדה בעיקר לבדיקות והערכה מהירה של ביצועים במערכות של החברה.

  • 12.6 GBמשקל הקבצים
  • 4,079הורדות בחודש
  • 136לייקים

מה זה

מדובר בהמרה ישירה של גרסת הצ'אט בעלת 7 מיליארד פרמטרים מבית מטא, שנארזה מחדש לעבודה עם Core ML בפורמט float16. המטרה כאן היא לא לפרוץ דרך ביכולות השיחה, אלא לאפשר למפתחי מק ו־iOS לטעון את המשקלים ישירות לחומרה שלהם בלי להסתבך עם המרות עצמאיות.

ההבדל המשמעותי נמצא באופן שבו בנו את הקובץ. במקום חלון גמיש, ההמרה הזו קובעת אורך רצף קשיח של 64 טוקנים בלבד. זה הופך את המודל למוצר לבדיקות טכניות בלבד, כדי לראות שהחיבור למנוע של אפל רץ, ולא למשהו שיכול להחזיק שיחה אמיתית או לעבד מסמכים.

מתאים ל

  • בדיקת תאימות לחומרת אפל

    אימות מהיר שהשילוב של Core ML והמעבד הגרפי של המק מצליח לייצר טוקנים בלי לקרוס.

  • מדידת זמני תגובה מקומיים

    בדיקת ביצועי השהיה של מודל שבעה מיליארד פרמטרים ב־float16 על המעבדים של אפל.

  • השלמת משפטים קצרים באופליין

    ייצור פקודות קצרות לחלוטין על המכשיר כשיש מגבלת רשת, כל עוד הפלט לא עובר 64 טוקנים.

איפה זה נופל

המגבלה הכי קשה היא אורך הרצף הקבוע של 64 טוקנים. אי אפשר להזין פרומפט ארוך, ואי אפשר לקבל פלט מעבר לכמה משפטים בודדים באנגלית, כשרצף כזה בעברית ייגמר אפילו מהר יותר בגלל פירוק הטוקנים. היוצרים מצהירים במפורש שהקובץ מיועד להערכה ובדיקות בלבד, כך שלא מדובר במשהו שאפשר להכניס לפיצ'ר חי במוצר שלכם.

שאלות
נפוצות

האם המודל מתאים ליישום שיחה מלא למשתמשי אייפון?

לא. המודל הומר עם אורך רצף קשיח של 64 טוקנים, מה שקוטע כל שיחה סבירה כמעט מיד. בנוסף, משקל של מעל 12 ג'יגה בייט כבד מדי לרוב מכשירי הטלפון.

איך המודל מתמודד עם טקסטים בעברית?

בסיס המודל הוא לאמה 2 המקורי של מטא, שהאימון שלו התמקד בעיקר באנגלית. בשילוב עם מגבלת 64 הטוקנים, כל שאלה בעברית תבזבז את רוב התקציב על הטוקניזציה ותחזיר מענה חלקי מאוד.

איך מריצים

בשביל להריץ אותו צריך מכשיר אפל עם זיכרון מאוחד מספק, כי הקבצים תופסים 12.6 ג'יגה בייט והם יושבים ב־float16. זה אומר שמק עם 8 ג'יגה בייט זיכרון ייחנק מיד, ותצטרכו לפחות 16 ג'יגה בייט כדי לטעון אותו לצד מערכת ההפעלה.

אם אתם צריכים שיחה שוטפת שמחזירה תשובות ארוכות, אין מה לחפש כאן. עדיף לפנות ל־API חיצוני שמריץ את לאמה 2 בשרת מרוחק, במקום לשרוף משאבים על המרה שמראש מוגבלת לתשובות קצרצרות במכשיר.

from transformers import pipeline

pipe = pipeline("text-generation", model="enterprise-explorers/Llama-2-7b-chat-coreml")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ומפנה לתנאים המקוריים של מטא עבור Llama 2 ולמדיניות השימוש שלהם. שימוש מסחרי מותר בדרך כלל תחת המגבלות של מטא, אבל חובה לעיין בקובץ הרישיון המקורי ולוודא עמידה בהגבלות לפני הפצה באפליקציה.

הרישיון המלא בעמוד המודל ↗