GPT
R

ReaderLM-v2

קוד פתוח

jinaaicc-by-nc-4.02025-01-13

  • transformers
  • onnx
  • safetensors
  • qwen2
  • text-generation

יש כאן גם סקירה על Jina AI עצמו.

מודל ייעודי להמרת דפי HTML למרקפח מקורץ או ל־JSON מובנה, עם תמיכה בעד 512,000 טוקנים. פתרון ממוקד למי שצריך לחלץ תוכן נקי מסריקת אתרים בלי לשלם על מודלי ענק.

  • 1.5Bפרמטרים
  • 512,768טוקנים בהקשר
  • 21.9 GBמשקל הקבצים
  • 1,086הורדות בחודש

מה זה

במקום לקחת מודל שפה כללי כדי לגרד אתרים, כאן מדובר בהתאמה ייעודית על בסיס Qwen2.5 בנפח של 1.5 מיליארד פרמטרים. הוא מיועד למשימה אחת ברורה, לקחת קוד HTML גולמי ולהחזיר מרקדאון נקי כולל טבלאות, משוואות וקוד, או לחלץ נתונים ישירות למבנה JSON מוגדר לפי סכמה, בלי שלב ביניים.

היתרון המרכזי מול מודלים קטנים אחרים הוא הטיפול בהקשר ענק של עד חצי מיליון טוקנים, מה שמאפשר להזין דפי אינטרנט שלמים ומורכבים. במדדי המרת מרקדאון הוא מציג תוצאות כמו ROUGE-L של 0.84 ודימיון Jaro-Winkler של 0.82, מספרים שמציבים אותו מעל מודלים כלליים גדולים בהרבה כמו Qwen2.5-32B או Gemini2-flash במשימה הספציפית הזו. בחילוץ JSON הוא שומר על אחוז מעבר של 0.98 וציון F1 של 0.81.

מתאים ל

  • חילוץ תוכן מאתרים למרקפח

    ממיר דפי רשת עמוסים לקבצי טקסט נקיים שמתאימים למאגרי ידע ולמערכות RAG.

  • גרידת נתונים מובנית ישירות

    שולף שדות ספציפיים מתוך דפי חדשות או מוצרים ישירות ל־JSON לפי סכמה מוגדרת מראש.

  • עיבוד דפי אינטרנט ארוכים

    תומך בחלון הקשר של עד 512,000 טוקנים, מה שמתאים למסמכים כבדים בלי לחתוך אותם מראש.

איפה זה נופל

למרות ההתמחות ב־HTML, המודל עדיין מוגבל מבחינת דיוק מבני ואיכות כוללת, עם ציונים של 35 מתוך 50 בדיוק מבני ו־39 מתוך 50 בשמירה על תוכן בהערכות האיכות. זה אומר שהוא עלול לפספס חלקים מסוימים בדפים מורכבים במיוחד. בנוסף, חובה לנקות את ה־HTML לפני ההזנה ולהסיר סקריפטים וסגנונות כדי לא לחנוק את הזיכרון. המודל תומך ב־29 שפות אבל עברית לא מוזכרת ברשימה המפורטת, ולכן צריך לבדוק היטב איך הוא מתמודד עם טקסט מימין לשמאל ומבנה עברי לפני שמשלבים אותו בזרימת עבודה.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כדי לחלץ עברית מדפי אינטרנט מקומיים?

הכרטיס מציין תמיכה ב־29 שפות ומפרט רשימה של שפות אירופאיות ואסיאתיות וכן ערבית, אך עברית לא מוזכרת במפורש. כיוון שהוא מבוסס על Qwen2.5 יש לו היכרות בסיסית עם עברית, אבל מומלץ לבצע בדיקה מדגמית של פלט ה־JSON והמרקדאון כדי לוודא שאין שיבושים בסדר המילים או החמצה של תווים ייחודיים.

כמה זיכרון כרטיס מסך נדרש כדי לעבד דפים ארוכים בפועל?

המשקל של המודל עצמו קטן יחסית, אבל כשפותחים הקשר של מאות אלפי טוקנים צריכת הזיכרון מזנקת בצורה חדה. כרטיס בסיסי כמו T4 יעבוד לאט ויסבול ממגבלות זיכרון עקב חוסר תמיכה ב־bfloat16, ולכן לשימוש שוטף בדפים כבדים מומלץ כרטיס עם 24GB זיכרון כמו RTX 3090 או 4090.

איך מריצים

מריצים אותו מקומית עם transformers וכרטיס מסך, או בסביבת Colab עם vllm ו־triton. למרות שמדובר במודל קטן יחסית, כדי לנצל הקשרים ארוכים באמת ולעבוד ב־bfloat16 עם flash attention תצטרכו כרטיס מודרני כמו RTX 3090 או RTX 4090. על כרטיס T4 פשוט הוא ירוץ לאט יותר ויצרוך יותר זיכרון, עם קצב של כ־67 טוקנים לשנייה בקלט ו־36 טוקנים לשנייה בפלט.

מי שלא רוצה להחזיק שרת יכול להשתמש ב־Reader API של Jina דרך כותרת ייעודית, או להרים מכונה ב־AWS וב־Azure. ב־API הקריאות אליו צורכות פי שלושה ממכסת הטוקנים הרגילה והתכונה עדיין מוגדרת ניסיונית, כך שאם יש נפח עבודה גבוה וקבוע, הרצה עצמית על חומרה מתאימה תהיה הגיונית יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="jinaai/ReaderLM-v2")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה, מותר להשתמש במודל, לשנות אותו ולהריץ אותו לצרכי מחקר, ניסויים ופיתוח פנימי שאינו מסחרי, עם מתן קרדיט. אסור להשתמש בו במוצר מסחרי שמייצר הכנסה או כחלק משירות בתשלום ללא רישוי מתאים מיוצרי המודל.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗