حين لا تكفي الصلة وحدها: الصلاحية الزمنية في الاسترجاع
قد يتناول المقطع المسترجَع الموضوع الصحيح، ومع ذلك لا يصلح للوقت الذي يسأل عنه السؤال. أيّ الأوقات تهمّ هنا، وماذا يعني ذلك لتصميم الاسترجاع؟
إجابة ذات صلة، لكن في غير وقتها
لنفترض أننا طرحنا على نظام استرجاع سؤالًا عن فترة سابقة من علاج مريض: «ماذا كان المريض يتناول عند tq؟» وفي سجلّه ثلاث ملاحظات قصيرة. الملاحظات افتراضية ومبسّطة عمدًا: A وB علاجان، والأوقات مرتبة هكذا: t1 < tq < t2 < t3 < t4.
- الملاحظة الأولى، كُتبت عند t1: «بدأ المريض تناول الدواء A.»
- الملاحظة الثانية، كُتبت عند t2: «أُوقف الدواء A، وانتقل المريض إلى الدواء B.»
- الملاحظة الثالثة، كُتبت عند t3: «يتناول المريض حاليًا الدواء B منذ انتقاله إليه من الدواء A، والمراجعة مقرّرة.»
أيّ هذه الملاحظات يسلّمها النظام إلى النموذج؟ الثلاث تتحدث عن علاج المريض، والثلاث تذكر A. للوهلة الأولى يبدو الاختيار سهلًا، فهناك قاعدة شائعة لمثل هذه الحالة: إذا بدت عدة مقاطع ذات صلة، فخذ أحدثها. وبهذه القاعدة تفوز الملاحظة الثالثة. هي الأحدث، وتتكلم عن دواء المريض بصيغة الحاضر، وتذكر دواءً بعينه. والإجابة التي تقترحها هي B.
لكن السؤال لا يسأل عن الحاضر. الإجابة الصحيحة هي A. الملاحظة الأولى تخبرنا أن A بدأ عند t1، وملاحظة الانتقال تخبرنا أنه انتهى عند t2. ووقت السؤال يقع بين الاثنين، إذن كان المريض يتناول A في ذلك الوقت. لا تكفي أيّ من الملاحظتين وحدها لحسم ذلك، لكنهما معًا ترسمان حدود الفترة التي كان فيها A ساريًا.
الملاحظة الثالثة صحيحة في ذاتها. لكن الحالة التي تصفها، أي B، لم تبدأ إلا بعد tq. إنها تتحدث عن الموضوع الصحيح، في الوقت الخطأ. وإذا اعتمدنا عليها في الإجابة عن هذا السؤال، صارت دليلًا غير صالح زمنيًا (wrong-time evidence).
أعطت قاعدة «الأحدث أولًا» إجابة معقولة، لكن عن سؤال آخر: «ماذا يتناول المريض الآن؟». وعن السؤال المطروح فعلًا، أعطت إجابة خاطئة. يضع الشكل 1 الملاحظات الثلاث على خط الزمن: كلها ذات صلة، لكن ما كان ساريًا عند tq لا تحدّده إلا ملاحظة البدء وملاحظة الانتقال معًا.
هذا التمييز ليس جديدًا، لكنه يضيع بسهولة داخل مسار الاسترجاع. الصلة الدلالية تسأل: هل يتحدث الدليل عن الموضوع الصحيح؟ والصلاحية الزمنية تسأل: هل ما يصفه الدليل ينطبق في الوقت الذي يقصده السؤال؟ في بقية هذه التدوينة: لماذا يفترق المفهومان، وما الذي يغيّره ذلك في التصميم. والخلاصة باختصار: الأحدث ليس بالضرورة هو الصالح زمنيًا.
لماذا لا تحسم الصلة الدلالية أمر الصلاحية الزمنية
الاسترجاع الكثيف مبنيّ أصلًا للحكم على الصلة. في Dense Passage Retrieval (Karpukhin et al., 2020 )، يحوّل مُرمِّزان النص إلى متجهات، أحدهما للأسئلة والآخر للمقاطع، ويُقاس التشابه بين السؤال والمقطع بالجداء النقطي لمتجهيهما. ويصف المؤلفون التدريب بأنه تعلّمُ مقاييس (metric learning): لكل سؤال مقطع واحد ذو صلة وعدة مقاطع لا صلة لها به، ودالة الخسارة تكافئ النموذج حين يعطي المقطع ذا الصلة درجة أعلى من المقاطع السلبية.
هذا الهدف يدور حول الصلة بين الأسئلة والمقاطع. لا شيء فيه يشترط صراحةً أن يكون المقطع صالحًا في الوقت الذي يقصده السؤال. زوج التدريب يقول إن هذا المقطع يستحق درجة عالية مع هذا السؤال، ولا يقول إلى أيّ وقت يشير أيّ منهما. وبهذا المعيار، قد تكون عبارة «يتناول المريض حاليًا الدواء B» مطابقة ممتازة لسؤال عمّا كان المريض يتناوله.
ولا يعني ذلك أن المسترجِعات الكثيفة عمياء عن الزمن. فالتواريخ جزء من النص، والتضمينات (embeddings) قادرة على ترميزها. وقد يلتقط النموذج إشارات زمنية بطريقة غير مباشرة، إذا صادف أن بيانات تدريبه تكافئها. النقطة هنا أضيق من ذلك: الصلاحية الزمنية ليست ما يحسّنه هدف الصلة المعتاد بشكل مباشر. وكل ما يتعلّمه النموذج عن الزمن يأتي عَرَضًا، على هامش هدف صُمّم ليحسّن الصلة، لا الصلاحية الزمنية.
بعض الأعمال في الإجابة عن الأسئلة الحساسة للزمن تتعامل مع الحكمين كلٌّ على حدة. يقسم MRAG (Zhang et al., 2025 ) مثلًا السؤال إلى محتواه الأساسي وقيده الزمني، ثم يعطي كل دليل درجتين منفصلتين: واحدة للصلة الدلالية وأخرى للصلة الزمنية. وفي تحليل مضبوط، وجد المؤلفون أيضًا أن طرق الاسترجاع التي اختبروها أعطت الأولوية لمطابقة التواريخ حرفيًا، ويصفون ذلك بأنه طريق مختصر في الاستدلال الزمني. مطابقة التاريخ دليل زمني مفيد، لكنها شيء، والتحقق من أن الدليل صالح للوقت الذي يسأل عنه السؤال شيء آخر.
المطلوب إذن أن نُبقي الخاصيتين منفصلتين. التشابه يستهدف الصلة مباشرةً. والصلاحية الزمنية لا يضمنها التشابه وحده، ولا الحداثة وحدها. قد يأتي أيٌّ منهما بدليل صالح، لكن لم يُصمَّم أيٌّ منهما ليتحقق من أنه صالح.
عن أيّ وقت نتحدث؟
عبارة «وقت الملاحظة» توحي بأن للملاحظة وقتًا واحدًا. لكن لننظر إلى ما تقوله الملاحظة الثالثة فعلًا: «يتناول المريض حاليًا الدواء B منذ انتقاله إليه من الدواء A، والمراجعة مقرّرة.» كُتبت عند t3. وتتحدث عن انتقال حصل قبل ذلك، عند t2. وتذكر مراجعة لم تحدث بعد، مقرّرة عند t4. ثلاثة أوقات في ملاحظة قصيرة واحدة، والسؤال يضيف وقتًا رابعًا. ويجب أن نفرّق بينها.
- وقت الوثيقة، أو وقت إنشاء الوثيقة (DCT): متى كُتبت الملاحظة.
- وقت الحدث: متى وقع أمر تصفه الملاحظة، أو متى يُفترض أن يقع. وقد تشير الملاحظة الواحدة إلى عدة أحداث.
- فترة الصلاحية: الفترة التي تبقى فيها حالةٌ ما سارية. تناولُ المريض للدواء A حالة، والانتقال عند t2 حدث، وهو الذي أنهى تلك الحالة.
- وقت الاستعلام: الوقت الذي يقصده السؤال، وهو هنا tq.
تُظهر الملاحظة الثالثة لماذا لا يصح أن نختزل هذه المفاهيم في مفهوم واحد. وقت وثيقتها tD = t3. وهي تعود إلى الوراء، إلى الانتقال عند t2، ولهذا لا يرد فيها A إلا بصيغة الماضي. وتنظر إلى الأمام، إلى المراجعة المقرّرة عند t4، أي بعد كتابتها. ملاحظة واحدة، ووقت وثيقة واحد، وأوقات أحداث قبله وبعده. ويجمع الشكل 2 المفاهيم الأربعة على خط واحد.
وقت السؤال لم يتغيّر. ما زال tq، قبل الانتقال، ولم يكن B قد بدأ بعد. الملاحظة الثالثة تحمل أحدث وقت وثيقة في السجل، ووقت الوثيقة هو بالضبط ما ترتّب به قاعدة «الأحدث أولًا». لكن الصلاحية الزمنية تسأل سؤالًا مختلفًا: هل الحالة المعنية قائمة في الوقت الذي يقصده السؤال؟ قد تفيد قاعدة «الأحدث أولًا» في الأسئلة عن الحاضر، لكن كون الدليل أحدث لا يثبت وحده أنه صالح زمنيًا. وفي الأسئلة التاريخية، قد تجيب القاعدة عن سؤال آخر تمامًا.
وهنا أيضًا يظهر الفرق بين مواكبة المستجدات والصلاحية. الأعمال التي تهتم بمواكبة المستجدات، مثل FreshLLMs (Vu et al., 2024 )، تستهدف أسئلة تحتاج إلى معرفة محدَّثة بالعالم. هذا هدف حقيقي، لكنه غير الإجابة الصحيحة عن وقت مضى. فالسؤال التاريخي قد يحتاج إلى أدلة أقدم، والملاحظة المكتوبة حديثًا قد تحكي عن أحداث أقدم منها. ومن يعامل أحدث وثيقة على أنها الأصلح يخلط بين الأمرين.
ولا شيء من هذه التمييزات جديد على المعالجة الزمنية للغة الطبيعية. ربط الأحداث بالتعابير الزمنية في النصوص السريرية مهمة راسخة: في تحدي i2b2 لعام 2012، قُيّمت أنظمة تستخرج من ملخصات الخروج من المستشفى الأحداثَ السريرية والتعابير الزمنية والعلاقات الزمنية بينها (Sun, Rumshisky & Uzuner, 2013 ). وإذا اختزل تصميم الاسترجاع هذه الفروق في طابع زمني واحد، فقد يضيّع معلومات يحتاجها الاستعلام.
الصلاحية غالبًا فترة، لا لحظة
لنعد إلى مثالنا. عبارة «بدأ المريض تناول الدواء A» تفتح فترة A عند t1. لكنها وحدها تخبرنا متى بدأ A، ولا تقول شيئًا عن متى توقف. معرفة البداية لا تعني معرفة المدة: من هذه الملاحظة وحدها، لا يستطيع النظام أن يستنتج أن A كان ساريًا عند tq إلا إذا افترض أنه استمر.
ملاحظة الانتقال هي التي تغلق الفترة عند t2. صحيح أنها كُتبت بعد tq، لكنها جزء من الدليل على الإجابة، لأنها تُظهر أن A بقي قائمًا حتى الانتقال، أي أنه كان قائمًا عند tq أيضًا. فتحديد فترة الصلاحية قد يحتاج إلى أدلة من عدة ملاحظات: على البدء، أو التوقف، أو الاستمرار، أو الزوال. وبعض هذه الأدلة يُكتب بعد الوقت المعنيّ.
وهذه الزاوية تغيّر أيضًا طريقة قراءتنا لملاحظات تبدو متناقضة. «بدأ المريض تناول الدواء A» تعني A، و«يتناول المريض حاليًا الدواء B» تعني B. ولا خطأ في أيٍّ منهما: A كان ساريًا، ثم حلّ B محلّه. ويختفي التناقض بمجرد أن نضع كل حالة في فترتها. ولهذا النوع من الاستدلال وُجدت تمثيلات الفترات. فجبر الفترات الذي وضعه Allen (Allen, 1983 ) انطلق جزئيًا من ملاحظة أن التمثيلات القائمة على التواريخ أو اللحظات الزمنية تقصر حين تكون المعرفة الزمنية غير دقيقة أو نسبية. لذلك يستدل بدلًا منها على العلاقات بين الفترات نفسها.
قد يعترض أحد: لماذا لا نصفّي الأدلة فلا نستخدم إلا الملاحظات المكتوبة حتى وقت السؤال، document_time <= query_time؟ تبدو هذه طريقة نظيفة لمنع النظام من رؤية المستقبل.
لنأخذ مثالًا افتراضيًا آخر، مستقلًا عن سجل الملاحظات الثلاث. لا ملاحظة انتقال فيه، بل ملاحظة كُتبت بأثر رجعي، نسمّيها 2′. والأوقات مرتبة هكذا: t1 < ts < tq < t2′.
- الملاحظة الأولى، كُتبت عند t1: «بدأ المريض تناول الدواء A.»
- توقف A فعلًا عند ts، أي قبل tq.
- الملاحظة 2′، كُتبت لاحقًا عند t2′، بعد tq: «كان الدواء A قد أُوقف عند ts.»
عند tq لم يكن A ساريًا، والملاحظة اللاحقة هي الوحيدة التي تقول ذلك. لكن المصفاة تحذفها، لأن وقت وثيقتها يأتي بعد tq.
بعد التصفية، تبقى «بدأ المريض تناول الدواء A» الدليل الوحيد. وهي تخبرنا متى بدأ A، لا هل كان المريض لا يزال يتناوله عند tq. فإذا خلص النظام منها إلى A، فلأنه افترض أن الحالة استمرت، بعد أن حُذف الدليل اللاحق الذي كان سيؤكد هذا الاستمرار أو ينفيه. يبيّن الشكل 3 أيّ ملاحظة تمرّ من المصفاة وأيّها تُحذف. لكنه لا يُظهر لماذا يهمّ هذا الحذف: المصفاة تتحكم في متى كُتبت الملاحظات، والسؤال يتعلق بمتى كانت الحالات قائمة. الملاحظة 2′ كُتبت متأخرة عن أمر حدث مبكرًا. ولو حكمنا عليها بوقت وثيقتها، لبدت دليلًا من المستقبل. لكنها، في هذا السجل، الدليل الوحيد على أن A توقف.
المصافي الزمنية الصارمة ليست خاطئة في ذاتها. فهي مفيدة حين يكون القيد الزمني صريحًا والطوابع الزمنية موثوقة. لكنها تصبح هشّة حين يكون وقت الوثيقة مجرد بديل تقريبي لوقت الحدث، أو حين يكون الدليل نسبيًا («بعد أسبوعين من البدء»)، أو غير مؤكد، أو مسجَّلًا بأثر رجعي. والحفاظ على هذه الروابط الزمنية، كلٌّ بالدقة التي يملكها فعلًا، مشكلة توسيم قائمة بذاتها. وهذا الجانب تتناوله دراسة حالة التوسيم الزمني: الروابط الزمنية، ودرجة التفصيل الزمني، ووسم ما بقي غير محدد صراحةً بدل ملئه.
ما الذي يغيّره هذا في تصميم الاسترجاع
سؤال «هل تكفي الصلة الدلالية في الاسترجاع الحساس للزمن؟» هو ما دفعني إلى العمل على جانب الاسترجاع في مذكرة مهندس الدولة. وكان قد طرح نفسه أول مرة وأنا أكتب مذكرة الماستر، وهي مراجعة منظمة وسّعتُ فيها زاوية النظر لأدرس التوليد المعزَّز بالاسترجاع الزمني (Temporal RAG) ككل: أساليبه، وطرق تقييمه، وتحدياته المفتوحة. وإذا فكّرنا بعقلية التصميم، تترتب على الأمثلة السابقة بضع نتائج.
وقت الوثيقة سياق مفيد، لكنه لا يكفي وحده. هو غالبًا أوثق طابع زمني تملكه الملاحظة، ويجب الاحتفاظ به، لكنه يسجّل متى كُتبت الملاحظة، لا متى وقع ما تصفه. خذ الملاحظة الثالثة: كُتبت عند t3، لكنها تتحدث عن انتقال سابق حصل عند t2. ولو فهرسناها بتاريخها وحده، لبدت دليلًا على ما كان عند t3. لهذا تستحق الروابط الزمنية للأحداث داخل الملاحظة أن تُحفظ هي الأخرى، مع درجة تفصيلها وما فيها من عدم يقين. عبارة «في 2024» لا تحدد يومًا بعينه، وتخزينها كأنها يوم محدد يخترع دقة لم تكن في المصدر أصلًا. والروابط النسبية أو غير المحددة تبقى موسومة على حقيقتها.
وحين تتوفر هذه الروابط، يمكن للزمن أن يصبح إشارة ثانية إلى جانب الصلة الدلالية. فالموضوع الصحيح يبقى شرطًا، ولهذا يأتي الزمن مكمّلًا للصلة، لا بديلًا أعمى عنها. المصافي الزمنية الصارمة تناسب القيود الصريحة والموثوقة. وفي غير ذلك، يمكن استخدام الزمن إشارةً في الترتيب، فيحفظ أدلة كان القطع الصارم سيحذفها. تذكّر الملاحظة 2′: قطعٌ صارم بتاريخ الوثيقة عند tq كان سيحذفها، مع أنها الملاحظة الوحيدة التي تقول إن A كان قد توقف.
ويبقى تغييران: واحد قبل الاسترجاع، وآخر بعده. قبل الاسترجاع، نحتاج إلى فهم النطاق الزمني للسؤال. انظر إلى هذه الأسئلة الثلاثة: «ماذا كان المريض يتناول عند tq؟» و«ماذا يتناول المريض الآن؟» و«هل تناول المريض A في أيّ وقت؟». تشترك في معظم كلماتها، لكن كلًّا منها يحتاج إلى أدلة مختلفة. الأول يسأل عن لحظة محددة في الماضي، فيحتاج إلى ملاحظتي البدء والانتقال معًا. والثاني يسأل عن الآن، فيحتاج إلى أحدث ملاحظة. والثالث يسأل عن أيّ وقت، فتصلح له أيّ ملاحظة تذكر A. وبعد الاسترجاع، نحتاج إلى تقييمه بمعزل عن التوليد. فحين لا نقيّم إلا الإجابة النهائية، قد يختبئ الدليل غير الصالح زمنيًا وراء إجابة تبدو صحيحة بالمصادفة. أما حين نقيّم الأدلة المسترجعة نفسها، فيصبح الاسترجاع في الوقت الخطأ شيئًا يمكن رصده.
لنعد إلى السؤال الذي بدأنا به: ماذا كان المريض يتناول عند tq؟ الملاحظات الثلاث كلها ذات صلة، والثالثة هي الأحدث. لكن ما يحسم الإجابة هو فترة صلاحية A، التي فتحتها «بدأ المريض تناول الدواء A» وأغلقتها ملاحظة الانتقال، وموقع tq من هذه الفترة. أيّ الملاحظات أحدث؟ هذا لا يحسم شيئًا.
ويبقى أمام المجال سؤالان مفتوحان. كيف ينبغي للاسترجاع أن يمثّل الصلاحية حين تكون نهاية الفترة مجهولة، أو محددة فقط نسبةً إلى حدث آخر؟ وكيف نقيّم الاسترجاع حين تتوقف صحة الإجابة نفسها على الزمن، فيكون المقطع نفسه دليلًا صالحًا لسؤال، ودليلًا غير صالح زمنيًا لسؤال آخر؟
المراجع
- Allen, J. F. (1983). Maintaining Knowledge about Temporal Intervals. Communications of the ACM, 26(11), 832–843. doi:10.1145/182.358434
- Karpukhin, V., Oguz, B., Min, S., Lewis, P., Wu, L., Edunov, S., Chen, D., & Yih, W. (2020). Dense Passage Retrieval for Open-Domain Question Answering. In Proceedings of EMNLP 2020, 6769–6781. doi:10.18653/v1/2020.emnlp-main.550
- Sun, W., Rumshisky, A., & Uzuner, O. (2013). Evaluating temporal relations in clinical text: 2012 i2b2 Challenge. Journal of the American Medical Informatics Association, 20(5), 806–813. doi:10.1136/amiajnl-2013-001628
- Vu, T., Iyyer, M., Wang, X., Constant, N., Wei, J., Wei, J., Tar, C., Sung, Y.-H., Zhou, D., Le, Q., & Luong, T. (2024). FreshLLMs: Refreshing Large Language Models with Search Engine Augmentation. In Findings of ACL 2024, 13697–13720. doi:10.18653/v1/2024.findings-acl.813
- Zhang, S., Xue, Y., Zhang, Y., Wu, X., Luu, A. T., & Zhao, C. (2025). MRAG: A Modular Retrieval Framework for Time-Sensitive Question Answering. In Findings of EMNLP 2025. doi:10.18653/v1/2025.findings-emnlp.167