GPT
F

FalconLite

קוד פתוח

amazonapache-2.02023-08-01

  • transformers
  • RefinedWeb
  • text-generation
  • custom_code

גרסה מכווצת של פלקון 40B שמותאמת לקריאת טקסטים ארוכים של עד 11 אלף טוקנים. היא דורשת רבע מכמות זיכרון הווידאו של המקור בזכות כיול ל־4 ביט.

  • 20.7 GBמשקל הקבצים
  • 85הורדות בחודש
  • 171לייקים

מה זה

מדובר בהתאמה של המודל Falcon 40B SFT OASST-TOP1, שמנצלת קוונטיזציה בשיטת GPTQ יחד עם שינויים בשכבות ה־RotaryEmbedding כדי להרחיב את חלון ההקשר המקורי פי חמישה. הקבצים שוקלים 20.7 גיגה בייט, מה שמכניס מודל בסדר גודל כזה לטווח ריצה על שרת בודד.

במבחני ביצועים הוא שולף נושאים או מפתחות בודדים בהצלחה של 92 עד 100 אחוזים גם בהקשר מלא של 11 אלף טוקנים. במענה על שאלות מתוך טקסט ארוך הוא מגיע ל־46.9 אחוזי דיוק במבחן הכללי, ול־40.8 אחוזים בחלק הקשה שלו. קצב היצירה נע בין 10 ל־18 טוקנים לשנייה בשרת g5.12x, ועד 22 טוקנים לקלט קצר במכונה גדולה יותר.

מתאים ל

  • סיכום מסמכים ארוכים

    הוא קורא עד 11 אלף טוקנים ברצף ומסוגל לעבד חוזים ומאמרים מלאים בלי לחתוך אותם לחלקים קטנים.

  • איתור נושאים בטקסט עמוס

    מבחני ההערכה מראים דיוק של מעל 90 אחוז בזיהוי נושאים כלליים גם כשהקלט מתקרב למגבלת הזיכרון.

  • שאלות ותשובות על תוכן רחב

    התאמת המודל מאפשרת לחקור מאגר ידע קיים בלי לאמן מחדש, אם כי רמת הדיוק הכללית עומדת על כ־47 אחוז.

איפה זה נופל

הנקודה החלשה ביותר היא שליפת שורות מדויקות מתוך טקסט ארוך. בעוד שבקלט קצר הוא עומד על 38 אחוזי הצלחה בלבד, בטקסטים של מעל 9,000 טוקנים הדיוק צונח עד ל־4 אחוזים, כך שאי אפשר להסתמך עליו למציאת נתון נקודתי בתוך מסמך צפוף. מעבר לזה, המודל אומן והוגדר לעבודה בשפה האנגלית בלבד, ואין נתונים על יכולות בשפות אחרות.

שאלות
נפוצות

האם המודל מתאים לשליפת עובדה מדויקת מתוך מסמך גדול?

לא. המבחנים בכרטיס המודל מראים שבמשימות שליפת שורות הדיוק מתרסק ל־4 אחוזים באורכי טקסט גבוהים, ולכן הוא לא מתאים לחיפוש מחט בערימת שחת.

האם אפשר להריץ אותו על שרת ייעודי סטנדרטי בלי ענן של אמזון?

החבילה דורשת סקריפטים שנבנו סביב TGI 0.9.2 וקוונטיזציה של 4 ביט. המפתחים הגדירו ותיעדו פריסה על שרתי g5 של AWS, כך שהעברה לסביבה עצמאית אחרת תדרוש התאמות ידניות של הקונטיינר.

איך מריצים

בשביל להריץ אותו צריך שרת AWS עם מעבדי GPU, למשל מופע מסוג g5.12x עם תמונת Deep Learning AMI. ההרצה מתבססת על גרסה 0.9.2 מותאמת של Text-Generation-Inference מתוך סקריפטים וקונטיינר דוקר של המפתחים, או פריסה ישירה ל־SageMaker דרך מחברת פייתון ייעודית.

בעלייה ראשונה של המודל יש שלב חימום של עשרות שניות שבו התגובות מתעכבות, ורק אחריו מגיעים לקצב עבודה סדיר. לעומסי עבודה כבדים ומתמשכים המפתחים ממליצים לעלות למופע g5.48x שמציע יותר זיכרון ונפח עיבוד, כך שאם הפעילות שלכם לא קבועה, החזקת שרתים כאלה פעילים תעלה לא מעט כסף.

from transformers import pipeline

pipe = pipeline("text-generation", model="amazon/FalconLite")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ עותקים ולשלב אותו בתוך תוכנה סגורה, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗