מודלים לשוניים בעברית לפענוח לקונות בקומראן וכלי עזר מוסבר לחוקרים
שחזור ידני מבוסס על היכרות רחבה של החוקר עם אוצר המילים וסגנון המגילה, ועל מדידה פיזית של חלל הפער על גבי הקלף.
מודל שפה מתקדם מסוגל להציע עדות סמנטית ותחבירית מקיפה מכלל הטקסטים ששרדו, ולשפר את איכות ההצעות משמעותית.
מכיוון שהמגילות מכילות כפילויות רבות וקטעים חופפים, חלוקת משפטים אקראית רגילה (Sentence-level Split) גורמת לדליפת טקסט ישירה בין סט האימון לסט המבחן.
חלוקה ברמת Scroll-level מבטיחה הערכת הכללה יציבה ואמיתית על מגילות שלא נראו מעולם.
DictaBERT-lex. המדידה מתעלמת מהבדלי כתיב מלא/חסר (כול/כל, כיא/כי, לוא/לא), אותיות סופיות וגרסאות שם השם (יי/יהוה).
מודל MsBERT שנבחר כמקודד הליבה הוא מודל של מילים שלמות (Whole-Word). הראינו שהוא מקודד מילים עבריות מורכבות (כולל קידומות ויחס) כטוקן בודד.
זה מבטיח שהמודל מקבל סיגנל מסיכה בודד לכל מילה חסרה, ללא כל רמז (Leakage) לגבי מספר האותיות או הטוקנים המרכיבים אותה.
מודלים מבוססי חלקי מילים (Subwords) כמו BEREL קיבלו בעבר תוצאות מעולות. גילינו שהקוד "הדליף" להם את אורך חלקי המילה מראש (כמו לדעת את מספר האותיות באיש תלוי). פיתחנו פענוח דינמי ללא דליפה. ברגע שחסמנו את ההדלפה, ביצועי BEREL קרסו.
| מודל / סוג הערכה | מילה 1 חסרה | 2 מילים | 3 מילים | 4-5 מילים | 6+ מילים |
|---|---|---|---|---|---|
| MsBERT ft-SPAN-refined (שלנו - מילים שלמות) | 37.3% | 34.7% | 31.1% | 29.4% | 31.0% |
| TavBERT (tau/tavbert-he - ברמת האות) | 30.0% | 23.0% | 23.3% | 21.5% | 26.3% |
| BEREL ft-SPAN (סאב-טוקנים - הערכה אופטימית) | 36.0% | 30.7% | 28.4% | 25.4% | 26.8% |
| BEREL (סאב-טוקנים - פענוח דינמי ריאליסטי) | 26.0% | 21.0% | 20.7% | 14.9% | 6.9% |
קריסה דרמטית של BEREL בלקונות ארוכות (מ-23.6% ל-6.9%) מוכיחה את נחיצות מודל המילים השלמות (MsBERT) שאינו דורש מידע מוקדם על אורך.
שילוב נירמול למות בדירוג, אילוץ אורך פיזי וחלון הקשר 40 מילים:
| מנגנון פענוח | 1 מילה | 2 מילים | 3 מילים | 4-5 מילים | 6+ מילים |
|---|---|---|---|---|---|
| סטנדרטי (Beam Search) | 32.0% | 34.0% | 34.0% | 28.4% | 35.7% |
| מועצם (Enhanced) | 36.0% | 36.0% | 36.7% | 32.0% | 39.8% |
האופטימיזציה המאוחדת מעלה את דיוק השחזור ב-2.0% עד 4.1% בכל דלי, ומביאה לקונות ארוכות מאוד ל-39.8% דיוק.
בהערכה על 300 פערים באורך לא-ידוע, שילוב RAG מעלה את דיוק הרצף הכללי מ-6.0% ל-8.3% Top-1 (+38.9% שיפור יחסי):
| מנגנון | 1 מילה | 2 מילים | 3 מילים | משוקלל |
|---|---|---|---|---|
| ללא RAG (MsBERT Top-1) | 12.0% | 3.0% | 3.0% | 6.0% |
| עם RAG (Top-1) | 14.0% | 7.0% (+133%) | 4.0% | 8.3% (+38.9%) |
| RAG + פענוח מועצם (Top-10) | 48.0% | 35.0% | 34.3% | 36.8% |
שילוב RAG עם אילוץ אורך פיזי ואיחוד למות מעלה את דיוק ה-Top-10 למילה בודדת ל-48.0% ול-36.8% בממוצע כללי.
כדי שהכלי לא יהיה "קופסה שחורה", אנו מציגים לחוקר באילו מילים המודל השתמש. ניתוח של 9,000+ מילים מראה ש-32% ממשקל הקשב מרוכז ב-3 המילים הסמוכות ללקונה, ושמילות תוכן מקבלות פי 2 קשב מאותיות חיבור.
רמת דיוק Slot-Level Top-10 לקבוצת הביקורת:
| אורך הלקונה | דיוק מקראי |
|---|---|
| מילה 1 חסרה | 57.5% |
| 2 מילים חסרות | 48.8% |
| 3 מילים חסרות | 37.5% |
| 4-5 מילים חסרות | 36.2% |
ביצועים אלו משמשים כרף היכולת העליון (Performance Ceiling) של המודלים בעברית קלאסית.
<GAP>, והחלוקה בין אימון למבחן נעשתה ברמת המגילה.
ללא אילוצים פיזיים: 9.5% Top-10 על אותם 74 אתרים.
עם אותיות שמורות ואורך ±1: 63.5% Top-10 ברמת האתר, עם רווח סמך של 51.4%–74.3%.
בדיקת רגישות: 69.5% באורך מדויק, 63.5% ב־±1 ו־62.7% ב־±2.
חשוב: זהו שיפור במפענח המלא בזכות מידע פיזי, לא קפיצה של 54 נקודות במודל השפה עצמו.
שחזור כתובות ביוונית ולטינית בעזרת Transformers, הצעת רשימות Top-K, מפות קשב וחיפוש מקבילות (RAG) לאורכים לא ידועים.
מודל מילים שלמות (Whole-word MLM) לשחזור לקונות בכתבי יד עבריים מתקופת ימי הביניים (טקסטים רבניים וליטורגיים).
שחזור לוחות יתדות באכדית/בבלית בעזרת מודלי שפה ופענוח דינמי מבוסס תוויות המשך (##).
שחזור לקונות בטקסטים מקראיים בעברית וארמית.
מודל מבוסס תווים (Character-level BERT) בעברית המיועד לניקוד, ניתוח מורפולוגי וזיהוי ישויות.
בחינת המודל המכוונן שלנו (MsBERT ft-SPAN) על קורפוס טקסטים עבריים היסטוריים חיצוניים (קהיר/רבניים).
פלטפורמת מחקר דיגיטלית (TEI-XML/JSON) המשלבת קואורדינטות פיקסל של קטעי המגילות, יישור טקסטולוגי והצעות שחזור מהדירים.
ארכיון צילומים מולטי-ספקטראליים (Infrared) ברזולוציה גבוהה של כל 25,000+ קטעי המגילות, ממופה לפי לוחות ומספרי קטע.
צילום מצב שמור מ־21 במאי 2026 כולל 1,811 קריאות מפורשות ב־346 אתרים ו־253 מקורות ביבליוגרפיים. המאגר משמש להערכה בלבד ולעולם אינו נכנס לאימון.
https://dss-restoration-demo.pages.dev/slides_he.html ובקוד פתוח ב-GitHub.
התוצאה 63.5% מודדת מפענח עם אילוצים פיזיים; ללא האילוצים, אותם אתרים משיגים 9.5% Top-10.