GPT
R

reader-lm-0.5b

קוד פתוח

jinaaicc-by-nc-4.02024-09-06

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

יש כאן גם סקירה על Jina AI עצמו.

מודל קומפקטי שממיר קוד HTML גולמי לטקסט נקי בפורמט Markdown. הוא מתאים למי שרוצה לנקות עמודי אינטרנט מקומי בלי לשלם על קריאות API חיצוניות.

  • 494Mפרמטרים
  • 256,000טוקנים בהקשר
  • 953 MBמשקל הקבצים
  • 117הורדות בחודש

מה זה

מדובר בגרסה הקטנה של סדרת המודלים מבית Jina AI, שמבוססת על ארכיטקטורת Qwen2 וכוללת חצי מיליארד פרמטרים. המטרה שלו מוגדרת וצרה מאוד: אתם מזינים לו HTML של אתר שלם, והוא פולט Markdown מסודר שמכיל רק את תוכן העמוד, בלי תפריטים, סקריפטים ושאר רעשי רקע.

היתרון המשמעותי מול ספריות regex או כלים מסורתיים מבוססי חוקים הוא היכולת להבין מבנה של עמוד בצורה סמנטית. חלון ההקשר שלו מגיע ל־256 אלף טוקנים, כך שאפשר לדחוף לתוכו עמודי רשת ארוכים במיוחד בלי לחתוך אותם מראש.

מתאים ל

  • הכנת דאטה ל־RAG

    ניקוי מהיר של עמודי אינטרנט למסמכי Markdown לפני חיתוך ויצירת וקטורים למאגר מידע.

  • סקייפינג מקומי של אתרים

    חילוץ טקסט רציף מתוך HTML גולמי על מחשב אישי בלי לשלוח מידע לרשת ובלי עלויות ענן.

  • אימון מודלים על דאטה רשתי

    המרת כמויות גדולות של עמודי אינטרנט לטקסט קריא ודחוס כהכנה לאימון מודלי שפה.

איפה זה נופל

זה מודל של 494 מיליון פרמטרים בלבד, והגודל הזה גובה מחיר. במבני HTML סבוכים במיוחד, עמודים עמוסים בטבלאות שבורות או קוד מלוכלך מדי, הוא עלול לפספס חלקים מהתוכן, לבלבל קישורים או להמציא טקסט בתוך ה־Markdown. יש לו גם אח גדול יותר של 1.5B שנבנה לאותה מטרה בדיוק, וסביר להניח ששם הדיוק במקרים מורכבים יהיה גבוה יותר. בנוסף, חלון של 256K על מודל כזה קטן עלול להאט משמעותית את זמן התגובה כשהקלט מתארך.

אותה משפחה

reader-lm יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוסיף פרומפט עם הנחיות לפני ה־HTML?

לא. המודל אומן לקבל ישירות את ה־HTML הגולמי כקלט בתוך תבנית הצ'אט, ללא צורך בהוראות מקדימות כמו תמיר לי למרקداון.

האם יש גרסת transformers מסוימת שצריך להתקין?

כן, לפי התיעוד של הפרויקט יש להשתמש בגרסת transformers שהיא 4.43.4 ומטה כדי שהמודל ייטען בצורה תקינה.

איך מריצים

המודל שוקל פחות מג'יגה בייט בפורמט bfloat16, מה שאומר שאפשר להריץ אותו כמעט על כל דבר. הוא רץ ישירות דרך ספריית transformers של פייתון, ונכנס בקלות לזיכרון של מעבדים גרפיים בסיסיים כמו T4 חינמי ב־Colab, ואפילו על מעבד רגיל בלי לקרוס.

אם יש לכם שרת מקומי קטן ואתם צריכים לגרד אלפי עמודים ברצף, הרצה מקומית תחסוך לכם כסף. אם מדובר על משימות מזדמנות או שאין לכם תשתית זמינה, יש למודל גרסאות מנוהלות ב־AWS וב־Azure Marketplace שחוסכות את הצורך לתחזק שרת פייתון עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="jinaai/reader-lm-0.5b")
print(pipe("שלום"))

הרישיון

הרישיון כאן הוא cc-by-nc-4.0. המשמעות פשוטה וחד משמעית: אסור להשתמש במודל הזה לשום מטרה מסחרית. מותר להריץ אותו למחקר, לפרויקטים אישיים, ללמידה ולבדיקות פנימיות, אבל אם אתם בונים מוצר שמוכר מנויים או מייצר הכנסה, לא תוכלו להטמיע אותו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗