GPT
G

gemma-2B-10M

קוד פתוח

mustafaaljaderymit2024-05-07

  • transformers
  • safetensors
  • endpoints_compatible

גרסה ניסיונית של ג'מא שמנסה לדחוס הקשר ענק של עשרה מיליון טוקנים לתוך כרטיס מסך בודד. היא מיועדת למי שרוצה לבדוק מנגנוני זיכרון חדשים על מסמכים באורך ספר שלם.

  • 2.5Bפרמטרים
  • 9.4 GBמשקל הקבצים
  • 63הורדות בחודש
  • 228לייקים

מה זה

המודל הזה לוקח את הבסיס המוכר של ג'מא עם שניים וחצי מיליארד פרמטרים ומלביש עליו ארכיטקטורה של תשומת לב מקומית חוזרת, בהשראת רעיונות כמו אינפיני-אטנשן וטרנספורמר-אקס-אל. המטרה כאן היא לפתור את צוואר הבקבוק של זיכרון ה־KV, שבמודלים רגילים גדל במהירות ולא מאפשר לעבד טקסטים ארוכים באמת.

במקום לקרוס כשהטקסט מתארך, הזיכרון כאן גדל בצורה ליניארית ומאפשר, לפי המפתחים, להגיע לעשרה מיליון טוקנים בהרצה שדורשת פחות משלושים ושניים גיגה זיכרון. מה ששונה פה מול גרסאות רגילות בגודל הזה הוא היכולת להחזיק ספרים שלמים או מאגרי קוד עצומים בזיכרון בלי להזדקק לחוות שרתים ענקית.

מתאים ל

  • סיכום ספרים שלמים

    חלון הקשר של עשרה מיליון טוקנים מאפשר להזין טקסטים ספרותיים באורך מלא בלי לחתוך אותם לחלקים קטנים.

  • מחקר על זיכרון ליניארי

    הוא מתאים לבדיקת מנגנוני תשומת לב מקומית חוזרת על חומרה יחידה של פחות משלושים ושניים גיגה.

  • ניתוח מסמכי ענק מקומי

    הוא רלוונטי למי שחייב לעבד קבצי טקסט עצומים בלי לשלוח מידע לרשת ומחזיק כרטיס מסך תואם.

איפה זה נופל

זה לא מוצר שאפשר לשלב כרגע באפליקציה אמיתית. המפתחים עצמם כותבים שמדובר בצ'קפוינט מוקדם מאוד שעבר מאתיים צעדי אימון בלבד, כך שהיכולת שלו להבין טקסט מורכב או לענות בצורה מדויקת עדיין מוגבלת מאוד. חייבים לבדוק אם הוא בכלל שומר על קוהרנטיות ולא מאבד פרטים בהקשרים הארוכים שהוא מבטיח לקרוא לפני שבונים עליו משהו.

שאלות
נפוצות

האם המודל הזה מוכן לשימוש שוטף במערכות ייצור?

ממש לא. כרטיס המודל מציין בפירוש שמדובר בגרסה ראשונית מאוד אחרי מאתיים צעדי אימון בלבד, ולכן הוא לא יציב מספיק למערכות אמיתיות.

איזו חומרה בדיוק צריך כדי להשתמש בו?

צריך כרטיס מסך עם תמיכה בקיודה ולפחות שלושים ושניים גיגה זיכרון כדי להריץ את ההסקה המותאמת בלי שהמערכת תקרוס.

איך מריצים

בפועל אתם מורידים קבצים במשקל של תשעה נקודה ארבע גיגה וטוענים אותם ישירות דרך ספריית טרנספורמרס בפורמט בי-פלוט 16. לפי כרטיס המודל, מנגנון ההסקה מותאם לקיודה ודורש פחות משלושים ושניים גיגה של זיכרון עבודה כדי להריץ את חלון ההקשר המלא.

אם אין לכם כרטיס מסך מתאים עם לפחות שלושים ושניים גיגה זיכרון, אין מה לנסות להריץ את זה מקומית. עדיף לפנות ל־API חיצוני של ספק אחר אם אתם מחפשים יציבות, כי פה מדובר בקוד הרצה מותאם אישית שדורש התעסקות.

from transformers import pipeline

pipe = pipeline("text-generation", model="mustafaaljadery/gemma-2B-10M")
print(pipe("שלום"))

הרישיון

המודל מפורסם תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗