GPT
A

aya-23-8B-GGUF

קוד פתוח

bartowskicc-by-nc-4.02024-05-23

  • transformers
  • gguf
  • text-generation
  • en
  • fr

גרסת GGUF מכווצת למודל של Cohere, שמיועדת לעבודה רב לשונית מקומית על מעבד או כרטיס מסך ביתי.

  • 102 GBמשקל הקבצים
  • 1,347הורדות בחודש
  • 56לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית CohereForAI לפורמט שרץ ישירות דרך llama.cpp. המטרה המרכזית שלו היא יצירת טקסט בשמונה שפות ספציפיות: אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, יפנית וקוריאנית. במקום להוריד משקלים מלאים וכבדים, מקבלים כאן קבצים מכווצים בשיטות imatrix שמנסות לשמור על דיוק התוכן גם ברמות דחיסה אגרסיביות.

בגודל של שמונה מיליארד פרמטרים, הדגש כאן הוא על יכולת שיחה רב לשונית בלי להסתמך רק על אנגלית כברירת מחדל. מי שבונה פתרונות שדורשים עיבוד טקסט בשפות אירופיות או מזרח אסייתיות ימצא פה מענה מדויק יותר מרוב המודלים המקבילים בקטגוריית המשקל הזו, שמכוונים כמעט תמיד לאנגלית בלבד.

הקובץ לא כולל נתוני מבחנים מספריים בכרטיס, אבל הפורמט מאפשר לשלב אותו ישירות בספריות מקומיות ובכלים כמו LM Studio, בלי להקים תשתית שרתים מורכבת ויקרה.

מתאים ל

  • סיווג טקסטים ביפנית וקוריאנית

    המודל כולל אימון ייעודי לשפות מזרח אסייתיות, תחום שבו מודלים קטנים אחרים נכשלים לחלוטין.

  • צ'אט בוט רב לשוני מקומי

    מענה במערכות מקומיות ללא חיבור רשת עבור שפות אירופיות מרכזיות כמו צרפתית, גרמנית וספרדית.

  • מחקר על אובדן איכות בכיול

    מגוון הקבצים מאפשר לבדוק את התנהגות מודל ה־8B תחת דחיסות שונות מ־Q8 ועד IQ1 על אותה חומרה.

איפה זה נופל

החיסרון הברור ביותר לישראלים הוא היעדר מוחלט של עברית מרשימת השפות הנתמכות. המודל מוגדר ומאומן עבור שמונה שפות בלבד, ולכן ניסיון להפיק ממנו עברית יניב תוצאות שבורות או הזיות. בנוסף, גרסאות הקידוד הנמוכות מאוד כמו IQ1 ו־Q2_K מוגדרות כבעלות איכות ירודה במיוחד ולא מומלצות לשימוש תקין. נקודה קריטית נוספת היא תאימות: גרסאות ה־I-quants לא עובדות עם מאיצי דרייבר של Vulcan, כך שמשתמשי AMD צריכים לוודא שיש להם סביבת ROCm פעילה.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

לא. רשימת השפות הרשמית כוללת אנגלית, שפות אירופיות נבחרות, יפנית וקוריאנית בלבד. המודל לא אומן עבור עברית והוא לא מתאים למשימות בשפה זו.

איזה קובץ כדאי להוריד מתוך הרשימה?

קובץ aya-23-8B-Q4_K_M.gguf בגודל 5.05GB הוא הבחירה הבטוחה והמאוזנת. הוא שומר על איכות טובה של המודל המקורי ורץ בקלות על כרטיסי מסך ביתיים נפוצים.

האם אפשר להשתמש בזה באפליקציה בתשלום?

לא, הרישיון אוסר על שימוש מסחרי מכל סוג. אם אתם בונים שירות שמייצר כסף או מיועד לחברה מסחרית, תצטרכו לחפש מודל עם רישיון אפאצ'י או MIT.

איך מריצים

כדי להריץ אותו במהירות מקסימלית, צריך כרטיס מסך שיכול להכיל את כל הקובץ בזיכרון ה־VRAM שלו, עם מרווח של גיגה או שניים פנויים. גרסת Q4_K_M שוקלת 5.05GB והיא נקודת פתיחה מאוזנת לרוב המשתמשים עם כרטיס של 8GB. אם יש לכם חומרה חלשה יותר או זיכרון מוגבל, גרסאות IQ3 יורדות לאזור ה־3.5GB עד 4GB, אבל ידרשו תמיכה ב־cuBLAS או rocBLAS כדי לא לסבול מביצועים אטיים.

מורידים קובץ בודד דרך huggingface-cli ומריצים עם llama.cpp, תוך הקפדה על פורמט הפרומפט הספציפי של תגיות המערכת והמשתמש שהוגדרו לו. אם אין לכם מעבד גרפי מתאים ואתם צריכים רק שאילתות בודדות, עדיף להשתמש ב־API מרוחק.

ollama run hf.co/bartowski/aya-23-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש במודל הזה לצרכים מסחריים. אפשר להוריד אותו, לשנות אותו ולהריץ אותו למחקר, פרויקטים אישיים, הדגמות פנימיות או בדיקות, אבל אי אפשר לשלב אותו במוצר שנמכר ללקוחות או מייצר הכנסה ישירה. חובה גם לתת קרדיט ליוצרים המקוריים בעת הפצה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗