GPT
L

Llama3-8B-1.58-100B-tokens

קוד פתוח

HF1BitLLMרישיון לא דווח2024-09-10

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסה מכווצת בשיטת 1.58 ביט שלקחה את מודל ההוראות של מטא ואימנה אותו מחדש. מתאים למי שרוצה לבדוק כמה אפשר לחסוך במשאבים בלי להתרסק לחלוטין בביצועים.

  • 2.8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 1,305הורדות בחודש

מה זה

מדובר בניסוי מעשי של צוות מחיבוק פייס בארכיטקטורת BitNet 1.58b, כשהבסיס הוא Llama-3-8B-Instruct. במקום להישאר במשקל מלא, לקחו את המודל ואימנו אותו על מאה מיליארד טוקנים מתוך FineWeb-edu. בפועל הוא כולל כ־2.8 מיליארד פרמטרים פעילים ונשמר בקבצים ששוקלים יחד 3.6 גיגה בייט בלבד.

היוצרים בדקו אותו במדדים מוכרים כמו MMLU ומבחני פרפלקסיטי. במבחנים מסוימים הוא מתקרב לביצועים של המודל המקורי, אבל בממוצע הכללי הוא עדיין נשאר מאחוריו. זה לא תחליף ישיר של אחד לאחד, אלא הדגמה טכנולוגית לכמה אפשר לדחוס מודל שפה.

מתאים ל

  • מחקר קוונטיזציה קיצונית

    מאפשר לבחון את התנהגות ארכיטקטורת 1.58 ביט על חומרה מקומית צנועה.

  • ניסויי יצירת טקסט מקומיים

    רץ ישירות על כרטיסי מסך בסיסיים בלי צורך בשרתים יקרים או זיכרון ענק.

  • בדיקת איכות מול משקל

    משמש נקודת ייחוס להשוואה בין מודל דחוס למודל המקור של מטא.

איפה זה נופל

המפתחים מודים בגלוי שהביצועים הממוצעים שלו נמוכים בהשוואה ל־Llama 3 8B המקורי. הדחיסה האגרסיבית גובה מחיר ביכולות ההסקה והידע הכללי, והאימון הנוסף על מאה מיליארד טוקנים לא סגר את הפער במלואו.

בנוסף, המודל אומן על טקסטים מ־FineWeb-edu באנגלית, כך שאין כאן שום התאמה ייעודית לעברית. לפני שחושבים להכניס אותו לקוד שלכם, תצטרכו לבדוק בעצמכם איך הוא מתמודד עם משימות אמיתיות ולא להסתמך על מבחני המעבדה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בעברית?

המודל לא אומן על חומרים ייעודיים בעברית אלא על תת קבוצה של FineWeb-edu. הוא מבוסס על הטוקנייזר של מטא, כך שהוא מסוגל לקרוא אותיות בעברית, אבל איכות הפלט וההבנה יהיו נמוכות מאוד.

האם הוא נותן אותן תוצאות כמו Llama 3 8B הרגיל?

לא. בדוחות הבדיקה מובהר שהביצועים הכלליים שלו נמוכים מהמקור. יש מדדים בודדים שבהם הוא מתקרב אליו, אבל אי אפשר לצפות ממודל מכווץ ברמה כזאת להתנהג כמו מודל במשקל מלא.

למה ההתקנה דורשת התקנה מיוחדת מגיטהאב?

התמיכה במבנה ה־1.58 ביט מבוססת על שינויים שטרם נכנסו לגרסה היציבה של ספריית transformers. כדי להריץ את הקוד, חייבים להתקין את ה־pull request הספציפי שצוין בהוראות.

איך מריצים

כדי להריץ אותו צריך להתקין גרסה ספציפית של transformers ישירות מענף פיתוח בגיטהאב, כי התמיכה בארכיטקטורה הזו עדיין לא חלק מההפצה הרגילה. המודל עצמו נטען ב־bfloat16 באמצעות PyTorch ותופס פחות מארבעה גיגה בייט זיכרון כרטיס מסך.

כרטיס מסך פשוט יחסית עם שמונה גיגה בייט זיכרון יספיק פה מעל ומעבר להרצה מקומית. מצד שני, אם אתם צריכים תפוקה מיידית ויציבה למוצר קיים, עדיף לפנות ל־API חיצוני של מודל מלא ולא להסתבך עם ספריות לא רשמיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="HF1BitLLM/Llama3-8B-1.58-100B-tokens")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 3.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. המשמעות היא שאין לכם הרשאה חוקית ברורה להשתמש בו במוצר מסחרי או להפיץ אותו. כל עוד המצב הזה נמשך, מומלץ להתייחס אליו כפרויקט מחקר בלבד.

הרישיון המלא בעמוד המודל ↗