{"as_of":"2026-08-09T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e709c0d60a3940e37ffac93d3329e06a1bf19d9d69ed7d03ed98eeb75c72bc2","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T21:51:50.352388Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.16120/citation-record","integrity":"/paper/2605.16120/integrity","json":"/paper/2605.16120/citation-record.json","paper":"/paper/2605.16120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:52:52.070595Z","title":"In: ICCV (2021)","venue":null,"work_id":"695f8346-dc7c-4278-81fa-91539bc1b8e1","year":2021},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:6e62993b5f225babf385d65d33ce0af0ae6a1633e24d6c225d1cd7d313c9d05b","observation_id":"c40e712a-b1f1-453a-9dd0-a9e6ca7acb5b","resolution":{"observed_at":"2026-05-19T21:52:48.627958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of NAACL-HLT (2019)","venue":null,"work_id":"899d60e1-b12d-4cfc-bb87-f58ec9ef4fa3","year":2019},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:a7a7b87a65c1361aa6ebaa4427e7b7af0e5cc2ee25e233f361d472c492fdcf4f","observation_id":"48062d9f-015c-42d1-9e09-fdb4dcc0e65c","resolution":{"observed_at":"2026-05-19T21:52:48.629636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)","venue":null,"work_id":"88bcdf00-5588-46a2-9992-58790c84fdae","year":2025},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:70c4e67a19c5fa43e2f86fd4674c68f14935c7492e4c6359a667f510590baab6","observation_id":"9303fbd0-d2b2-4435-9b2d-46e1d68ad6c6","resolution":{"observed_at":"2026-05-19T21:52:48.619049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/mlfoundations/open_clip (2021)","venue":null,"work_id":"225b44a9-061d-4e51-826d-b7da3e9f13ec","year":2021},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:eedd5afe4eaa0e5c50c025ce1156d2495b84e4bae488739a1043118cb1b66bc4","observation_id":"fc06d334-be19-4405-b842-5cd18371b815","resolution":{"observed_at":"2026-05-19T21:52:48.610688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2022)","venue":null,"work_id":"7d93482f-6fa8-4384-a6e1-41f695e67b7d","year":2022},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:7e285c4e08d4a3ed08ee85fba58fee9788f447eff76a3b61f2a37c1d44d60ac2","observation_id":"dfe1b26d-e758-4b11-b762-d758729e292e","resolution":{"observed_at":"2026-05-19T21:52:48.615614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2021), https://github.com/PhilipMay/stsb-multi-mt","venue":null,"work_id":"c1376435-d082-4158-9e33-7fee0118c3d9","year":2021},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:5a490ae0573c2d1fccfaa7c5615c3b15d6b9938dd6626c96ae649c83991b360f","observation_id":"c4cc314e-a1bf-4b44-a5a8-7ac0a5de2fea","resolution":{"observed_at":"2026-05-19T21:52:48.612387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2020)","venue":null,"work_id":"624abe97-cb96-48f3-8076-8190620427f8","year":2020},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:a50cbdae8c975fa07281be22b4f87f926590f1d0db27f2f2c72c73d41b4b480e","observation_id":"66993f60-06e1-4ea8-adcd-7e86dd304977","resolution":{"observed_at":"2026-05-19T21:52:48.620718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:b2239021203a51e60ed4bcb1169903237e49237b6df7a065b3b16100a74bff12","observation_id":"264a7c1e-c2d4-4598-a31f-e2cb1f977af9","resolution":{"observed_at":"2026-05-19T21:52:48.216193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 38th International Con- ference on Machine Learning (2021)","venue":null,"work_id":"bac6863e-daef-46cf-af1c-62430f038200","year":2021},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:183f54a2ca571700fa3e6b9c50d8736e2db872ddb72a7a3c08bd32f8fefe14fa","observation_id":"cf14ef0a-70b4-4c38-a076-3a517755a74b","resolution":{"observed_at":"2026-05-19T21:52:48.622560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:f0033d45c743251ada50371ce4a28ad6653dff60f7bdd469eab9c7086190d4aa","observation_id":"ad3d6613-0aa2-493d-b26f-5ed83ea4ed78","resolution":{"observed_at":"2026-05-19T21:52:48.222618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13462","last_updated":"2024-11-17T09:20:17Z","snapshot_observed_at":"2026-07-06T17:47:34.522070Z","submitted_at":"2024-03-20T10:13:28Z","title":"Singular Value Decomposition for Single-Phase Flow and Cluster Identification in Heterogeneous Pore Networks","version":4},"cited_work":{"arxiv_id":"2403.13462","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.13462","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dac0c044-6213-4b9b-aa34-49a3aa2178a3","year":2024},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"cited_paper":"/paper/2403.13462","citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:99d9007ff4c00a94867534af6b44e1cbd655f82820fe4ea749efed72625fe5c5","observation_id":"e4da045b-6e2f-4a8d-8bcf-e320e11382d3","resolution":{"observed_at":"2026-05-19T21:52:48.219220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS Datasets and Benchmarks Track (2022) 12","venue":null,"work_id":"1a6e1fb5-d6d3-4032-a2a0-eed4c1b35f63","year":2022},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:cc6326f7094d8b228df9f1d62bbee381c6fdc5a624aa2576b6d66bad83858b36","observation_id":"6c3a7cd6-d60e-44dc-8293-fb60ae95f112","resolution":{"observed_at":"2026-05-19T21:52:48.614013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics (2018)","venue":null,"work_id":"53784a7f-d939-4487-9b15-46fb875a7a12","year":2018},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:06e0d6a07b6ff7acafca2cab97bf40717f325a6bb1b46200bfd3fe3959097c2b","observation_id":"28304391-d6a5-423e-8dbb-30332203923d","resolution":{"observed_at":"2026-05-19T21:52:48.624629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-07T21:35:40.193492Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":"2008.04838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-07-04T06:29:36.931995Z","title":"arXiv preprint arXiv:2008.04838 (2020)","venue":null,"work_id":"16ef49be-5783-4e0a-a993-09cdb1ab77c3","year":2008},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:4703fdb161596a86b1314688ea5d60f8afaa540fd9f91758672229dc11059d7e","observation_id":"42e1cdc7-e8f0-454d-b175-68df240d3c9c","resolution":{"observed_at":"2026-05-19T21:52:48.213249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Buntine, W., Fjeld, M., Tran, T., Tran, M.T., Huynh Thi Thanh, B., Miyoshi, T","venue":null,"work_id":"b1a2247a-24ae-436e-9a22-90905b5c62b5","year":2025},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:972762290b083810607ebfe0fdfd58b7d948147ebf3ae9b3a790de1cbb31dbe9","observation_id":"a303e418-a7d4-427f-a6b6-2f3f3cf97260","resolution":{"observed_at":"2026-05-19T21:52:48.617320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023)","venue":null,"work_id":"95d5cfa4-567f-4019-8b64-1202ed9aa7f1","year":2023},"citing_paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T21:51:50.352388Z"},"links":{"citing_paper":"/paper/2605.16120"},"observation_digest":"sha256:c350dc4403d7e3a540b2d4c9cfac272400e7a1519503caa2dec24c4a8731685d","observation_id":"9eea980b-427b-4739-9e17-6b3dcd81225d","resolution":{"observed_at":"2026-05-19T21:52:48.626368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.16120","last_updated":"2026-05-15T16:02:48Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-04T11:42:58.171052Z","submitted_at":"2026-05-15T16:02:48Z","title":"MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":12},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2605.16120."}