GPT
S

StripedHyena-Nous-7B

קוד פתוח

togethercomputerapache-2.02023-12-04

  • transformers
  • pytorch
  • safetensors
  • stripedhyena
  • text-generation

גרסת צ'אט שמחליפה את הטרנספורמר הרגיל בשילוב של מנגנוני קשב וקונבולוציות. המטרה היא מהירות יצירה גבוהה יותר וצריכת זיכרון קבועה בהקשרים ארוכים.

  • 7.6Bפרמטרים
  • 28.5 GBמשקל הקבצים
  • 216הורדות בחודש
  • 145לייקים

מה זה

במקום עוד שכפול של ארכיטקטורת Llama, יש כאן ארכיטקטורה היברידית שמשלבת בלוקים של Hyena יחד עם multi-head ו־grouped-query attention. הרעיון מגיע מעולמות עיבוד אותות ומודלים של מרחב מצב (SSM), שבהם פענוח הטקסט בבלוקי ה־Hyena דורש זיכרון קבוע ולא גדל לינארית עם כל טוקן שנוסף.

המודל אומן מראש על רצפים של עד 32 אלף טוקנים בשיתוף עם Nous Research, במטרה להציע אלטרנטיבה ישירה למודלי קוד פתוח מובילים בגודל 7B. היתרון המרכזי שהוא מציע אינו בהכרח דיוק שפתי עדיף, אלא מהירות דגימה גבוהה יותר וזמני השהיה נמוכים יותר בריצות של פרומפטים ארוכים.

מתאים ל

  • שיחה בהקשר ארוך באנגלית

    מתאים לטקסטים עד 32k טוקנים באנגלית בזכות ארכיטקטורה ששומרת על זיכרון קבוע בזמן פענוח.

  • מערכות עם דרישת שיהוי נמוך

    שילוב בלוקי Hyena מספק throughput גבוה וזמני תגובה קצרים יותר מטרנספורמרים רגילים בגודל 7B.

  • מחקר ארכיטקטורות שאינן טרנספורמר

    משמש לבדיקת מודלים היברידיים המשלבים gated convolutions עם שכבות קשב בעולם האמיתי.

איפה זה נופל

זהו מודל באנגלית בלבד ואין שום עדות בכרטיס לתמיכה סבירה בעברית. בנוסף, הארכיטקטורה הלא שגרתית דורשת התקנת ספריות ייעודיות וקרנלים מותאמים, מה שאומר שהתמיכה בכלים סטנדרטיים של אופטימיזציה ושרתים מוכנים מראש מוגבלת מאוד בהשוואה לעולם של מודלי טרנספורמר רגילים. אם חבילת התוכנה שלכם לא תומכת ב־kernels האלה, המודל פשוט לא ירוץ.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות דרך ספריית transformers הרגילה?

לא באופן מלא. אף על פי שהמודל מוגדר עם ספריית transformers, הכרטיס מציין בפירוש שחייבים להתקין קרנלים ייעודיים מהמאגר שלהם כדי להריץ אותו מקומית.

באיזה פורמט צריך להעביר לו את הפרומפט?

המודל מאומן לקבל הנחיות במבנה קבוע של מחרוזת פתיחה. התבנית הנדרשת היא Instruction לפני הפרומפט ו־Response לפני הטקסט שהמודל מייצר.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־28.5 ג'יגה בייט בפורמט bfloat16, כך שתצטרכו לפחות כרטיס מסך יחיד עם 24 ג'יגה בייט VRAM כמו RTX 3090 או A10 כדי לטעון אותו, או לחלופין לפנות למאיץ ייעודי לשרתים. שימו לב שהמודל משתמש בדיוק מעורב, והיוצרים מציינים במפורש שיש להחזיק רכיבים מסוימים (poles ו־residues) בדיוק של float32, במיוחד בהקשרים ארוכים.

ההפעלה המקומית לא עובדת ישר מהקופסה של Hugging Face transformers. כדי להריץ אותו עצמאית נדרשת התקנה של קרנלים מותאמים אישית (custom kernels) מתוך המאגר של הפרויקט. אם אתם רק רוצים לבדוק את הביצועים שלו לפני שאתם מתעסקים עם קומפילציות של קרנלים מקומיים, עדיף פשוט לגשת ל־Playground או ל־API של together ולחסוך את כאב הראש התשתיתי.

from transformers import pipeline

pipe = pipeline("text-generation", model="togethercomputer/StripedHyena-Nous-7B")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר ברישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗