GPT
A

AMD-Llama-135m

קוד פתוח

amdapache-2.02024-07-19

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-generation-inference

מודל שפה זעיר שנבנה בארכיטקטורת Llama2 וחולק איתה את אותו טוקנייזר. הוא מיועד בעיקר לשמש כמודל טיוטה להאצת הסקת מסקנות במודלים גדולים יותר.

  • 134Mפרמטרים
  • 2,048טוקנים בהקשר
  • 514 MBמשקל הקבצים
  • 12,450הורדות בחודש

מה זה

מדובר במודל שפה קטן במיוחד שאומן על מאיצי MI250 של AMD, על בסיס כ־670 מיליארד טוקנים ממאגרי SlimPajama ו־Project Gutenberg. הוא בנוי בדיוק לפי המבנה של Llama2 עם אוצר מילים של 32,000 טוקנים, מה שמאפשר להטמיע אותו ישירות בספריית transformers ללא התאמות מיוחדות.

היתרון המרכזי שלו מופיע בטכניקת Speculative Decoding. מכיוון שהוא חולק טוקנייזר וארכיטקטורה עם משפחת Llama, מודלים כמו CodeLlama-7b יכולים להיעזר בו כדי לייצר הצעות טוקנים מהירות. לפי בדיקות היצרן, שילוב כזה מניב האצה של פי 1.67 עד פי 3.88 בקצב יצירת הטקסט בלי לפגוע כמעט ברמת הדיוק של המודל הגדול. במבחנים סטנדרטיים כמו MMLU ו־ARC הוא מציג תוצאות דומות למודלים אחרים בקטגוריית 125M, כלומר יכולת הבנה בסיסית בלבד.

מתאים ל

  • מודל טיוטה לחיסכון בזמן

    מאיץ הסקה של Llama2 ו־CodeLlama בעזרת speculative decoding עד פי 3.88.

  • הרצה מקומית על NPU

    שוקל חצי גיגה ורץ ישירות על מעבדי קצה חלשים בלי לצרוך משאבי זיכרון כבדים.

  • מחקר על שרשראות אימון

    בסיס קל ונגיש לבדיקת ארכיטקטורת Llama2 על חומרת AMD בלי עלויות עתק.

איפה זה נופל

המודל הזה קטן מדי למשימות עצמאיות מורכבות. במבחן MMLU הוא עומד על ציון של כ־0.23, שזה שקול לניחוש אקראי בארבע אפשרויות. הוא לא מיועד לשיחה, אינו כולל כוונון להוראות, ואינו מסוגל לייצר טקסט מנומק או אמין בפני עצמו. מעבר לכך, חלון ההקשר שלו מוגבל ל־2,048 טוקנים בלבד, ואין לו כל אימון ייעודי לעברית, כך שפלט בשפה הזו צפוי להיות שבור לחלוטין.

שאלות
נפוצות

אפשר להשתמש בו בתור צ׳אטבוט קל משקל?

לא. אין לו כוונון לשיחה או הבנת הנחיות, והוא יפלוט טקסט אסוציאטיבי והזוי. בגודל 135 מיליון פרמטרים הוא נועד להשלמת טוקנים טכנית או כמאיץ למודל אחר, לא לשיחה עם אדם.

הוא עובד רק על כרטיסי מסך של AMD?

לא, הוא נתמך מלא בספריית transformers הסטנדרטית. למרות שהוא אומן על מאיצי AMD MI250, אפשר להריץ את המשקלים שלו על מעבדי אינטל, מעבדי אפל וכרטיסי Nvidia ללא תלות בחומרה מסוימת.

איך מריצים

כדי להריץ אותו מייבאים את LlamaForCausalLM מספריית transformers וטוענים את המשקלים. הקבצים שוקלים 514 מגה־בייט בלבד, כך שלא צריך שרת ייעודי או כרטיס מסך מפלצתי. כל מעבד מודרני במחשב נייד או NPU יכול להריץ אותו בקלות.

הוא קיים בגרסת בסיס ובגרסת קוד שנקראת AMD-Llama-135m-code. אם המטרה היא לקבל תשובות חכמות למשתמשי קצה, אין טעם להריץ אותו עצמאית ועדיף לפנות ל־API של מודל ענן גדול. מריצים אותו מקומית רק כשצריכים מודל עזר זול שרץ צמוד למודל שבעה מיליארד פרמטרים ומאיץ אותו.

from transformers import pipeline

pipe = pipeline("text-generation", model="amd/AMD-Llama-135m")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי קוד והפצה מחודשת ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים של AMD וצירוף עותק של הרישיון בתוצר הסופי שאתם שולחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗