GPT
A

Aria

קוד פתוח

rhymes-aiapache-2.02024-09-26

  • transformers
  • safetensors
  • aria
  • image-text-to-text
  • multimodal

מודל רב־תחומי שמפעיל רק 3.9 מיליארד פרמטרים בכל שלב מתוך 25 מיליארד בסך הכול. הוא קורא תמונות, מסמכים וסרטונים ארוכים בלי לזחול.

  • 25Bפרמטרים
  • 65,536טוקנים בהקשר
  • 47.2 GBמשקל הקבצים
  • 47,301הורדות בחודש

מה זה

הארכיטקטורה כאן מבוססת על מומחים. בזמן ריצה המודל מנתב כל טוקן לחלק קטן מתוך 25.3 מיליארד הפרמטרים שלו, מה שמאפשר לו לעבד חלון הקשר של 64 אלף טוקנים במהירות גבוהה יחסית לגודל שלו. היכולת הזו מכוונת בעיקר לקבצי מדיה כבדים, כולל סרטונים של מאות פריימים ומסמכים מרובי עמודים, בלי צורך לחתוך אותם מראש לגדלים קבועים.

במבחני ביצועים הוא עוקף מודלים פתוחים אחרים כמו פיקסטרל ולמה 3.2 בניתוח וידאו בבנצ'מרק LongVideoBench, וגם מציג תוצאות טובות יותר בקריאת גרפים ותרשימים מול מודלים סגורים כמו ג'מיני פלאש. בצד של טקסט טהור, במתמטיקה ובכתיבת קוד הוא נמצא מאחורי המודלים המסחריים הגדולים, כך שהיתרון האמיתי שלו מתמקד בעיבוד קלט חזותי ולא בהסקה לוגית מורכבת.

מתאים ל

  • ניתוח וסיכום וידאו

    יכולת לעבד 256 פריימים בעשר שניות עם חלון הקשר גדול לקטעים ארוכים.

  • חילוץ מידע מדוחות ותרשימים

    ציונים גבוהים במבחני הבנת מסמכים וקריאת גרפים ביחס למודלים פתוחים.

  • מענה על שאלות מתמונות

    הבנה חזותית כללית טובה לצד תמיכה בתמונות בגדלים וביחסי ממדים משתנים.

איפה זה נופל

הנתונים הרשמיים מציינים תמיכה בשפה האנגלית בלבד, כך שאין כאן התחייבות ליכולות בעברית או בהבנת טקסט מקומי מתוך תמונות. בנוסף, על אף שהמודל מהיר ברמת החישוב פר טוקן, דרישת הזיכרון שלו גבוהה מאוד ומחייבת כרטיס מסך יקר, בלי שקיימת כרגע גרסה מכווצת רשמית בחבילה הבסיסית.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מצהיר על תמיכה באנגלית בלבד. אם יש צורך בעיבוד מסמכים בעברית או תמונות עם טקסט מקומי, צריך לבדוק אותו ישירות לפני שמסתמכים עליו במוצר.

כמה זיכרון GPU צריך בשביל להריץ אותו?

צריך מאיץ בודד של 80 גיגה־בייט כמו A100 כדי להעלות את כל 25.3 מיליארד הפרמטרים בדיוק המקורי. חומרה חלשה יותר לא תספיק בלי כיווץ המשקלים.

איך מריצים

במשקל של 47 גיגה־בייט ובדיוק bfloat16, המודל הזה דורש כרטיס A100 של 80GB כדי לרוץ על מאיץ גרפי בודד. המפתחים ממליצים להתקין ספריות ייעודיות כמו flash-attn ו־grouped-gemm כדי לייעל את פעולת המומחים בחומרה.

אם אין לכם כרטיס כזה בענן או בשרת מקומי, אין טעם לנסות להריץ אותו על חומרה ביתית רגילה בלי קוונטיזציה. במצב כזה עדיף לגשת אליו דרך ממשק קיים או שירותי ענן שמציעים אותו מוכן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="rhymes-ai/Aria")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0. זהו רישיון פתוח שמתיר שימוש מסחרי חופשי, שינוי של המודל, הפצה ואימון נוסף, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗