GPT
B

Biggie-SmoLlm-0.15B-Base

קוד פתוח

nistenmit2024-07-29

  • transformers
  • pytorch
  • gguf
  • llama
  • text-generation

מודל בסיס זעיר של 181 מיליון פרמטרים שנוצר ממיזוג שכבות על גבי SmolLM. הוא מיועד למי שמחפש בסיס קל לאימון המשך או רוצה להריץ טקסט במהירות גבוהה על מעבד בודד.

  • 2,048טוקנים בהקשר
  • 947 MBמשקל הקבצים
  • 3,750הורדות בחודש
  • 241לייקים

מה זה

מדובר בהרחבה ניסיונית של המודל SmolLM-135M שהוגדל ל־35 שכבות בשיטות של מיזוג מודלים רציף. למרות השם שמציין 0.15B, המפתח עצמו הבהיר שמדובר בפועל ב־181 מיליון פרמטרים. המטרה העיקרית כאן היא לשמש כקרקע לאימונים נוספים ולא לתפקד כצ'אטבוט מוגמר מהקופסה.

הפרויקט משלב ניסויים עם אופטימייזר בשם GrokAdamW וטכניקות מיזוג אבולוציוניות. לפי המפתח, המודל שומר על קוהרנטיות טובה יותר מגרסת המקור, אבל הוא מגיע כמודל בסיס ולא עבר התאמה להוראות, כך שהוא בעיקר משלים טקסט ולא עונה ישירות לשאלות בלי כוונון נוסף.

מתאים ל

  • אימון המשך ייעודי

    משמש כבסיס קל משקל לכוונון על דאטה-סט צר עם צריכת זיכרון נמוכה.

  • הסקה מהירה על מעבד

    מייצר טקסט בקצב גבוה על ליבת CPU בודדת וללא תלות בחומרת GPU יקרה.

  • ניסויי מיזוג מודלים

    בדיקת טכניקות אימון ואופטימיזציה ניסיוניות על ארכיטקטורה קטנה.

איפה זה נופל

זהו מודל בסיס ולא מודל שיחה, והוא רגיש מאוד לפרמטרים של הדגימה. המפתח מודה במפורש שההגדרות הפנימיות עדינות ודורשות כיוונון זהיר, וכי בטמפרטורה רגילה הוא נשאר קוהרנטי רק למאה הטוקנים הראשונים.

השם בתיעוד שגוי ביחס למספר הפרמטרים האמיתי, חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, ואי אפשר לזרוק אותו למערכת מבצעית בלי לעשות לו קודם אימון ייעודי למשימה שלכם.

שאלות
נפוצות

אפשר להשתמש בו ישירות כעוזר אישי לשיחה?

לא. מדובר במודל בסיס שנועד להשלמת טקסט ולא עבר אימון הוראות. כדי לדבר איתו צריך להריץ עליו קודם כוונון ייעודי או להשתמש בגרסת הדגמה מאומנת.

כמה חומרה צריך כדי לאמן אותו מחדש?

לפי נתוני הפרויקט, הרצת סקריפט האימון דורשת כרטיס מסך עם 14 גיגה בייט זיכרון, או 8 גיגה בייט אם מורידים את גודל ה־batch ל־4.

איך מריצים

אין שום צורך בכרטיס מסך כדי להריץ אותו. המפתח מספק קובץ בכימות של שמונה ביט ששוקל 164 מגה בייט ורץ דרך llama.cpp על ליבת מעבד בודדת בקצב של 160 טוקנים לשנייה, בלי לגעת ב־GPU.

אם הכוונה היא רק להריץ הסקה, מריצים מקומית על כל מחשב נייד ישן בלי לחשוב פעמיים ובלי לגעת ב־API חיצוני. מצד שני, אם רוצים לאמן עליו סקריפטים מחדש, תצטרכו כרטיס מסך עם 8 עד 14 גיגה בייט זיכרון וידאו לפי הגדרות ה־batch size.

ollama run hf.co/nisten/Biggie-SmoLlm-0.15B-Base:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצר סגור ולהפיץ אותו הלאה, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗