GPT
S

SmolLM2-135M

קוד פתוח

HuggingFaceTBapache-2.02024-10-31

  • transformers
  • safetensors
  • llama
  • text-generation
  • en

מודל שפה של 135 מיליון פרמטרים ששוקל 260 מגה־בייט בלבד. הוא מתאים למי שרוצה להריץ מודל ישירות על המכשיר בלי שרתים ובלי תלות ברשת.

  • 135Mפרמטרים
  • 8,192טוקנים בהקשר
  • 260 MBמשקל הקבצים
  • 2,550,777הורדות בחודש

מה זה

המודל הזה אומן על שני טריליון טוקנים ממאגרים כמו FineWeb-Edu, DCLM ו־The Stack, בארכיטקטורה מבוססת Llama עם 30 שכבות. הוא מספק חלון הקשר של 8,192 טוקנים, נתון חריג מאוד לנפח כזה קטן, ומגיע ברמת דיוק של bfloat16 ששומרת על משקל קובץ נמוך להפליא.

מבחני הביצועים מראים שיפור קל לעומת הדור הקודם במדדים כמו ARC עם 43.9 ו־CommonsenseQA עם 33.9, אבל הם בעיקר מבהירים את המגבלות. עם ציון של 1.4 בלבד ב־GSM8K ו־4.1 ב־TriviaQA, ברור לגמרי שהוא לא מיועד לפתרון בעיות מתמטיות או שליפת עובדות, אלא ליצירת טקסט בסיסית ורציפה.

מתאים ל

  • השלמת טקסט באנגלית במכשיר

    משקל של 260 מגה־בייט מאפשר להריץ השלמת משפטים באנגלית ישירות בתוך אפליקציית מובייל ללא חיבור אינטרנט.

  • אימון ובדיקות פיתוח

    בסיס זול ומהיר להרצת ניסויי fine-tuning על חומרה ביתית פשוטה לפני מעבר למודלים כבדים ויקרים.

  • יצירת טקסט על חומרת קצה

    מתאים למכשירי IoT פשוטים שצריכים לחולל תבניות טקסט מובנות באנגלית עם 723 מגה־בייט זיכרון בלבד.

איפה זה נופל

היוצרים מציינים במפורש שהמודל מבין ומייצר תוכן באנגלית בלבד. עברית לא נתמכת כאן, ולנסות להוציא ממנו פלט בעברית יוביל לתוצאות שבורות לחלוטין. בנוסף, הטקסט שהוא מייצר סובל מבעיות עקביות לוגית, הזיות וחוסר דיוק בעובדות. ציון ה־TriviaQA הנמוך מוכיח שהוא ממציא דברים בקלות, ולכן אסור להשתמש בו כמקור ידע אמין במוצר ללא בדיקת עובדות קשיחה.

אותה משפחה

SmolLM2 יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

לא. כרטיס המודל מציין תמיכה באנגלית בלבד, ואימון המודל התבסס על דאטה באנגלית. הוא לא יפיק עברית קריאה או הגיונית.

האם צריך כרטיס מסך של אנבידיה בשביל להשתמש בו?

ממש לא. הוא שוקל 260 מגה־בייט ותופס פחות מגיגה בזיכרון העבודה, כך שהוא רץ מהר מאוד על כל מעבד מודרני ממוצע.

האם אפשר לסמוך עליו לחישובים או שליפת מידע?

בשום אופן לא. המודל קיבל ציון 1.4 מתוך 100 במבחן המתמטיקה GSM8K ו־4.1 בלבד במבחן הטריוויה, מה שאומר שהוא יטעה וימציא תשובות.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון על גבי מעבד רגיל או כרטיס גרפי פשוט. בטעינה מלאה בזיכרון ב־bfloat16 הוא תופס סביב 723 מגה־בייט RAM, כך שאפילו מחשב ישן, טלפון או Raspberry Pi מריצים אותו בלי להרגיש מאמץ מיוחד.

אם אתם צריכים תשובות חכמות, היגיון מורכב או שיחה שוטפת ומדויקת, אין טעם להריץ אותו מקומית. במקרים כאלה עדיף בהרבה לשלם כמה אגורות ל־API של מודל ענן גדול, ולהשאיר את המודל הזה רק לתרחישים שבהם חייבים אפס עלויות שרת או עבודה אופליין לחלוטין.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceTB/SmolLM2-135M")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מופצים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולשלב אותו בתוך תוכנה סגורה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗