GPT
L

LiteLlama-460M-1T

קוד פתוח

ahxtmit2024-01-07

  • transformers
  • pytorch
  • llama
  • text-generation
  • llama2

שחזור מוקטן של ארכיטקטורת LLaMA 2 עם 460 מיליון פרמטרים שאומנו על טריליון טוקנים. פתרון קל משקל להרצה מקומית בלי דרישות חומרה כבדות.

  • 1,024טוקנים בהקשר
  • 882 MBמשקל הקבצים
  • 767הורדות בחודש
  • 168לייקים

מה זה

מדובר במודל שפה קטן במיוחד שמנסה להביא את הארכיטקטורה של LLaMA 2 לממדים זעירים. היוצר אימן אותו על כטריליון טוקנים מתוך המאגר של RedPajama, יחד עם הטוקנייזר הוותיק של GPT2. השילוב הזה נותן משקל קבצים כולל של פחות מגיגהבייט אחד, מה שמאפשר להטעין אותו כמעט בכל סביבת פיתוח.

במבחני הביצועים רואים תמונה מעורבת. במבחן MMLU עם חמש דוגמאות הוא מגיע לציון של 26.39, שזה קרוב למודלים גדולים ממנו כמו גרסאות מוקדמות של TinyLlama או OpenLLaMA. מצד שני, במבחני לוגיקה ומתמטיקה מורכבים כמו GSM8K הוא מקבל אפס עגול, כך שאין מה לצפות ממנו להבנה עמוקה או לפתרון בעיות.

מתאים ל

  • השלמת טקסט במכשירים חלשים

    משקל של פחות מגיגה מאפשר להריץ אותו ישירות על מעבדים פשוטים בלי כרטיס מסך ייעודי.

  • אימון נוסף למשימה מוגדרת

    גודל מזערי שמאפשר לבצע fine tuning מהיר וזול על נתונים ספציפיים באנגלית.

  • בדיקות סביבה וניסויי קוד

    יורד ונטען בשניות, מתאים לבדיקת צינורות עבודה של transformers לפני מעבר למודל כבד.

איפה זה נופל

חלון ההקשר קצר מאוד ועומד על 1,024 טוקנים בלבד, מה שמונע הזנה של טקסטים ארוכים. בדוגמת הקוד הרשמית של המפתח, המודל עונה ששחף שחור ראש הוא הציפור הגדולה ביותר, מה שממחיש את הנטייה שלו להזיות בעובדות פשוטות. נוסף על כך, הציון במבחן GSM8K הוא 0.0, והוא אומן באנגלית בלבד כך שאין לו תמיכה אמיתית בעברית.

שאלות
נפוצות

האם המודל מבין ופולט עברית?

לא. המודל אומן על מאגר RedPajama באנגלית ומשתמש בטוקנייזר של GPT2. ניסיון לכתוב לו בעברית ייצור פלט משובש ולא שמיש.

איזה כרטיס מסך צריך בשביל להריץ אותו?

לא חובה כרטיס מסך בכלל. הקבצים שוקלים 882 מגהבייט, כך שהוא נכנס בקלות לזיכרון של מעבד רגיל בכל מחשב מודרני.

האם הוא מתאים לצ'אט בוט?

לא כפי שהוא. מדובר במודל בסיס להשלמת טקסט שלא עבר כוונון לשיחה, והוא מייצר הזיות גם בשאלות טריוויה קצרות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers של פייתון באמצעות AutoModelForCausalLM וקוראים למשקלים ממאגר הקוד. המודל שוקל 882 מגהבייט בדיוק של bfloat16, מה שאומר שהוא ירוץ בלי בעיה גם על מעבד רגיל של מחשב נייד ישן או על כרטיס מסך בסיסי עם מעט מאוד זיכרון.

אם אתם צריכים תשובות מנומקות, ניתוח מסמכים או שיחה אנושית שוטפת, עדיף להשתמש ב־API חיצוני של מודל ענק. הפעלת מודל כזה אצלכם מתאימה רק אם התקציב אפסי, יש דרישה לעבודה ללא רשת, או שהמשימה מוגדרת וקבועה מראש.

from transformers import pipeline

pipe = pipeline("text-generation", model="ahxt/LiteLlama-460M-1T")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש או לשלב אותו בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗