GPT
L

Llama-3-8B-Instruct-32k-v0.1-GGUF

קוד פתוח

MaziyarPanahiרישיון לא דווח2024-04-24

  • transformers
  • gguf
  • mistral
  • quantized
  • 2-bit

גרסת GGUF מכווצת של לאמה 3 עם חלון הקשר מורחב ל־32k טוקנים. פתרון מתאים למי שרוצה להריץ שיחות ארוכות על חומרה מקומית בלי לגעת בענן.

  • 76.5 GBמשקל הקבצים
  • 159,607הורדות בחודש
  • 59לייקים

מה זה

מדובר בהמרה של דגם Llama 3 8B Instruct שעבר הרחבת הקשר ל־32k טוקנים ישירות לפורמט GGUF, מה שמאפשר לטעון אותו בכלים קלים כמו llama.cpp או LM Studio. הדגם המקורי של מטא מגיע עם חלון צנוע יחסית של 8k, כך שההרחבה הזו אמורה לעזור למי שמנתח מסמכים בינוניים או שומר היסטוריית שיחה ארוכה.

בכרטיס לא פורסמו מבחני ביצועים, מדדי ירידה באיכות או פרטים על שיטת ההרחבה. המשמעות היא שצריך לקחת את הנתון של 32k בזהירות, כי דגמים שמורחבים בלי אימון מסיבי נוטים לאבד דיוק בקצוות של הטקסט.

מתאים ל

  • קריאת מסמכים ארוכים

    חלון של 32k מאפשר להזין קבצים ומאמרים שלמים בלי לחתוך אותם לחלקים קטנים.

  • בוט שיחה עם זיכרון מקומי

    מתאים לשרת צ'אט פנימי שלא שוכח את ההתחלה אחרי עשר שאלות ורץ אופליין.

  • פיתוח ובדיקות על מחשב נייד

    פורמט GGUF נטען ישירות ב־LM Studio על חומרה ביתית לצורך ניסויים מהירים.

איפה זה נופל

הכרטיס ריק לחלוטין מנתוני ולידציה או בדיקות כמו Needle In A Haystack. כשמותחים הקשר של דגם 8B ל־32k, הוא עלול להמציא עובדות, לשכוח הנחיות מתחילת הפרומפט או לסבול מהידרדרות באיכות הפלט. בנוסף, אין שום מידע על יכולות בעברית, ולכן חובה לבדוק אותו על משימות ספציפיות לפני שסומכים עליו.

שאלות
נפוצות

צריך להוריד את כל 76 הגיגה כדי שהדגם יעבוד?

ממש לא. הנפח הכולל מורכב מ־20 קבצים שונים, שכל אחד מהם הוא כימות אחר של הדגם. אתם בוחרים ומורידים רק קובץ בודד שמתאים לגודל הזיכרון של כרטיס המסך או המחשב שלכם.

המודל הזה יודע לעבוד טוב בעברית?

דגמי הבסיס של Llama 3 מציגים הבנה מסוימת בעברית אבל הם לא אומנו עליה באופן ממוקד, ובכרטיס המודל אין שום התייחסות לשפות נוספות. כדאי לצפות לטעויות ניסוח ורמת דיוק נמוכה יותר מאשר באנגלית.

איך מריצים

כדי להריץ אותו צריך כלי שתומך ב־GGUF, כמו llama.cpp, KoboldCpp או LM Studio. המאגר כולל 20 קבצים בנפח כולל של 76.5 גיגה־בייט, כלומר יש כאן מגוון רמות כימות. מורידים רק קובץ אחד שמתאים לזיכרון שלכם.

גרסאות מכווצות של 8B רצות בקלות על מעבד גרפי ביתי עם 8 עד 12 גיגה־בייט VRAM, ואפשר להריץ אותן אפילו על זיכרון RAM רגיל של מחשב נייד חזק, אם כי בקצב איטי יותר.

ollama run hf.co/MaziyarPanahi/Llama-3-8B-Instruct-32k-v0.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של המודל. במצב כזה אסור להניח שמותר להשתמש בו במוצר מסחרי, גם אם הדגם המקורי של מטא מגיע עם תנאים מקלים יחסית. אם אתם בונים שירות לחברה, השימוש בו הוא סיכון משפטי עד שהיוצר יבהיר את תנאי ההפצה.

הרישיון המלא בעמוד המודל ↗