01 · הכישלון
הפסים השחורים נראו סופיים. הקובץ לא הסכים.
ב-19 בדצמבר 2025, המועד הסיים. חוק הגילוי של קבצי אפשטיין דרש מיוזמת המשפטים לפרסם את הרשומות שלה שלא סווגו בצורה שניתן לחפש בה, להוריד, תוך הגנה על קורבנות וקבוצה צרה של חומר רגיש אחר. מה שעלה לאינטרנט לא היה ארכיון יחיד ומסודר. זה היה זריקה מתגלגלת וממשכנת שנשלפה מחקירות שונות, בתי משפט וקבצים בפורמטים שונים.
הסקנדל היה סתירתי. יותר מ-500 עמודים בשחרור ההתחלתי היו מכוסים לחלוטין בשחור, לפי ספירה של CBS News. עם זאת, ניצולים ועורכי הדין שלהם אמרו גם כי מידע מזהה נותר חשוף - ובכמה קבצי PDF, ה-New York Times מצא שטקסט שהוסתר על ידי רצועות שחורות יכול היה להיות מחזור על ידי העתקה והדבקה במקום אחר.
הארכיון הצליח להיות יותר מדי מעותר וחסר עיתור בו-זמנית.
הסתירה המרכזית
02 · ציר הזמן
שלושים ימים קודם לכן, הקונגרס התחיל את השעון.

ארכיון חיפוש—תוך 30 ימים
חוק ציבורי 119-38 חתום. הוא מאפשר השמטות הגנת קורבנות, אך דורש שהרשומות המכוסות יהיו ניתנות לחיפוש והורדה, ואוסר השמטה בשל בי為שה, פגיעה בשם טוב או רגישות פוליטית.
ההקצבה מגיעה לפני הביטחון
הייצור הראשון מוצא קרקעות בין קבצים חסרים, עמודים שחורים בלתי מוסברים ומידע חשוף. מסמכים ממשיכים להופיע, להיעלם וחוזרים כאשר הבדיקה נמשכת.
הסולם הופך להיות גלוי.
משרד המשפטים מדווח שיותר מ-500 עורכי דין ובוחנים עבדו על המאמץ ומודיע על יותר משלוש מיליון עמודים נוספים. המכתב שלו מתאר זיהוי מסמכים כעבודה בעיקר ידנית ואיטרטיבית.
מפקח כללי פותח ביקורת
בודק הפנים של משרד המשפטים מתחיל בבדיקת איסוף, הנחיות עיתור וכיצד הטיפול של המחלקה בדאגות לאחר השחרור. ההסבר הסופי עדיין נבדק.
03 · בתוך הקובץ
קובץ PDF אינו עמוד. זו קבוצה של הוראות.
העיניים שלך רואות דף שטוח אחד. מחשב עשוי לראות גליפים טקסטואליים, צורות וקטוריות, תמונות סרוקות, הערות, שדות טפסים, מטא נתונים ושכבת OCR בלתי נראית - כל זה תופס את אותן קואורדינטות. מלבן שחור יכול להיות רק ההוראה הסופית: צייר את הצורה הזו על כל מה שבא לפני זה.
אז יש שתי פעולות שונות שמייצרות את אותה תמונה. רק אחת מהן מסירה משהו.
מה שאתה רואה
ש.אנא ציין את שם העד וכתובתו.
א.
ש.תודה. אין עוד שום דבר.
מה הקובץ מכיל
ש.אנא ציין את שם העד וכתובתו.
א.מרטה ריס, רחוב גרוב 118, ספרינגפילד
ש.תודה. אין עוד שום דבר.
קופסה שחורה משורטטת על השם.
04 · למה זה נכשל
שלוש כשלונות, ואף אחד מהם לא היה הרצועה השחורה.
יותר מדי עמודים, מעט מדי זמן
למשרד המשפטים היו 30 ימים לבדוק מיליונים של עמודים. יותר מ-500 עורכי דין וחוקרים ביצעו את העבודה ביד, מסמך אחרי מסמך. כאשר כל כך הרבה אנשים מקבלים כל כך הרבה החלטות כל כך במהירות, חלקן יהיו שגויות.
הסוקרים היו עורכי דין, לא מומחים ל-PDF
תפקידם היה להחליט מה החוק אמר להסתיר. הם סימנו שמות בתוכנת הסקירה והמשיכו הלאה. אך סימון שם אינו זהה להחזקתו מהקובץ, ולא אישר בשרשרת זו התבקש לבדוק איזה מהם בעצם קרה.
איש לא בדק את התוצאה
איש לא בדק אם לקבצי PDF המחויים הוסרה המידע. איש לא חיפש בטקסט את השמות שהיו אמורים להיעלם. אם זה היה נעשה, היה אפשר לתפוס את הטעויות בקלות.

הבדיקה היחידה שהתבצעה אי פעם הייתה האם העמוד נראה נכון.
05 · זרימת עבודה שונה
זרימת עבודה טובה יותר.
DocXee פותר את האתגרים לעיל בשיטת עבודה טובה יותר. שלוש הכישלונות היו מהירות, אי-היכרות עם פורמט הקובץ, ולא בדיקה בסוף. לכל אחד מהם יש תשובה.
- 01
אמור לזה מה להסיר, בשפה פשוטה
AI קורא את המסמך ומוצא עבורך התאמות. ההוראה יכולה להיות רחבה, כגון כל שם של אישה, או ספציפית, כגון שמות הקורבנות הידועים והשותפים שלהם. זה עובד דרך הקובץ כולו בדקות ולא בשבועות, וההוראה יכולה להיות כתובה בכל שפה.
- 02
ציין טווח עמודים
ספק כתוב טווח עמודים כדי להאיץ את עיבוד ה-LLM
- 03
DocXee מוציא את הטקסט
ה-LLM מציין אילו מילים להסיר והן נמחקות לצמיתות מהמסמך. העתקה, חיפוש וחילוץ טקסט חוזרים ריקים, כי אין שום דבר להשאיר.
- 04
עקוב אחר שינויים עם עורך מובנה
כל שינוי מסומן בעורך. קל לגלות אם משהו הוסתר או הושמט בטעות.
- 05
השוו בין שני הקבצים
כבדיקה נוספת, יצרו מסמך עם מעקב שינויים לאימות עצמאי.


מקורות
מקורות וקריאה נוספת
הערת עריכה: כתבה זו מבחינה בין עובדות תיעודיות מניתוחנו הטכני. תמונות המסמכים הן שכפולים של עבודות ממשלתיות פדרליות של ארה"ב. ביקורת המפקח הכללי נותרת בעיצומה בזמן כתיבה. היותו נקוב בקבצי אפשטיין אינו, בפני עצמו, ראיה לעוולה.
