GPT
S

snowflake-arctic-instruct

קוד פתוח

Snowflakeapache-2.02024-04-21

  • transformers
  • safetensors
  • arctic
  • text-generation
  • snowflake

מודל ענק שמפעיל רק חלק קטן מעצמו בכל ריצה, ומיועד למי שמחפש יכולות שפה וקוד בארכיטקטורת תערובת מומחים פתוחה לחלוטין.

  • 479Bפרמטרים
  • 4,096טוקנים בהקשר
  • 891 GBמשקל הקבצים
  • 3,431הורדות בחודש

מה זה

מדובר במודל שמשלב בסיס צפוף של 10 מיליארד פרמטרים יחד עם שכבת מומחים של 128 מומחים קטנים, כך שבסך הכל יש לו כמעט 480 מיליארד פרמטרים. הרעיון כאן הוא שבכל טוקן מופעלים רק 17 מיליארד פרמטרים באמצעות מנגנון שבוחר את שני המומחים המובילים. זה מאפשר לקבל קיבולת זיכרון וידע עצומים בלי לשלם על כוח החישוב של מודל ענק בכל צעד.

הוא מקבל טקסט ומחזיר טקסט או קוד, ועבר אימון הנחיות שמתאים למשימות מגוונות בארגונים. בניגוד למודלים צפופים רגילים, המבנה הזה מיועד לתת מענה מהיר יחסית בזמן הסקה, בהנחה שיש לכם את הברזלים שמסוגלים להחזיק משקל כזה בזיכרון.

מתאים ל

  • יצירת והשלמת קוד

    המודל פולט קוד ומאפשר פיתוח כלים פנימיים למתכנתים בארגון שרוצה רישיון פתוח לחלוטין.

  • מענה להנחיות ארגוניות

    גרסת האינסטראקט עברה התאמה להוראות מורכבות, ומתאימה לעיבוד טקסטים קצרים וממוקדים.

  • מחקר על ארכיטקטורת MoE

    בסיס פתוח שמאפשר לחקור התנהגות של תערובת מומחים גדולה עם 128 מומחים בפועל.

איפה זה נופל

המגבלה הכי בולטת היא חלון ההקשר. המודל מוגבל ל־4,096 טוקנים בלבד, שזה מעט מאוד למודל שיצא ב־2024 ובמיוחד למי שרוצה להזין קבצי קוד ארוכים, תיעוד טכני מלא או שיחות ממושכות. בנוסף, הוא מוגבל לטקסט וקוד בלבד ולא יודע לעבד תמונות או מסמכים ישירות. דרישות החומרה הקיצוניות הופכות כל ניסיון לבדוק אותו מקומית למהלך יקר ומורכב, כך שאם הפרויקט שלכם צריך ניתוח של מסמכים גדולים, הוא פשוט לא יתאים.

אותה משפחה

snowflake-arctic יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס גרפי ביתי או שרת קטן?

לא. המודל שוקל 891 גיגה בייט ומחזיק 479 מיליארד פרמטרים. ההמלצה הרשמית של המפתחים היא שרת של שמונה כרטיסי H100 עם קוונטיזציה של FP8 או FP6. שום חומרה ביתית או שרת פשוט לא יצליחו אפילו לטעון אותו לזיכרון.

למה שהמודל ידרוש הרצת קוד מותאם אישית בספריית transformers?

הארכיטקטורה שלו היא שילוב ייחודי של מודל צפוף ורשת מומחים שלא נתמכת ישירות כמודל ברירת מחדל ישן בספרייה. לכן צריך להגדיר trust_remote_code=True בקריאה למודל, ולהשתמש בגרסת transformers עדכנית מעל 4.39 יחד עם DeepSpeed מתאים.

איך מריצים

להריץ אותו בעצמכם זה סיפור יקר ומסובך. המשקלים שוקלים קרוב ל־900 גיגה בייט, וכדי להריץ הסקה תצטרכו שרת עם שמונה כרטיסי H100, כמו מופעי p5.48xlarge ב־AWS או המקבילים ב־Azure. ההרצה דורשת שימוש ב־DeepSpeed בגרסה 0.14.2 ומעלה יחד עם ספריית transformers, וקוונטיזציה של FP8 או FP6 כדי לדחוס את המודל לזיכרון.

בנוסף צריך להפעיל קוד מותאם אישית בריצת המודל. אם אין לכם גישה לתשתית ענן בעשרות אלפי דולרים או שרת 8xH100 ייעודי פנוי, אין טעם לנסות להרים אותו מקומית. במקרה כזה עדיף לחלוטין לחפש שירות שמציע לו גישה דרך API או להשתמש בדמו הקיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Snowflake/snowflake-arctic-instruct")
print(pipe("שלום"))

הקבצים

207 קבצים במאגר, 891 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לבנות עליו מוצרים או לאמן אותו הלאה, בלי לשלם תמלוגים ליוצרים ובלי לחשוף את קוד המקור של המוצר שלכם. התנאי היחיד הוא שמירה על הודעת הרישיון ומתן קרדיט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗