{"as_of":"2026-08-08T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d11ed5aa92df2696abc0415a70f28f1586d2d6ea904319fe62ac86c38f4a5f5","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:55:41.094698Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T01:20:57.490329Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:36:09.422158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"cited_work":{"arxiv_id":"2507.04289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M 3-med: A benchmark for multi-lingual, multi-modal, and multi- hop reasoning in medical instructional video understanding","venue":null,"work_id":"d10f1b28-cf21-41b4-bc05-593371c03210","year":2025},"citing_paper":{"arxiv_id":"2604.20319","last_updated":"2026-04-22T08:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T08:18:21Z","title":"SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:57.490329Z"},"links":{"cited_paper":"/paper/2507.04289","citing_paper":"/paper/2604.20319"},"observation_digest":"sha256:4267e4feb8cb95717ed29551892bd57478632b02cfa1224484558a6a465b2fac","observation_id":"933f59fc-0aec-49c4-84c3-d75423ceffb0","resolution":{"observed_at":"2026-05-11T13:36:09.424530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04289/citation-record","integrity":"/paper/2507.04289/integrity","json":"/paper/2507.04289/citation-record.json","paper":"/paper/2507.04289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.666188Z","title":"Video-language understanding: A survey from model architecture, model training, and data perspectives","venue":null,"work_id":"1b2d7a32-1931-4a34-a25a-bcbbf02ff508","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.848927Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:0eee236456b97960a0c7519fb10e28f7ed81763a0be9b17fad38905ea9c650f2","observation_id":"8e558589-f8de-4e52-94e3-437561ebe7c9","resolution":{"observed_at":"2026-08-06T19:55:44.767844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15918","last_updated":"2025-04-23T03:01:06Z","snapshot_observed_at":"2026-08-07T16:00:13.441669Z","submitted_at":"2025-04-22T14:03:16Z","title":"Ask2Loc: Learning to Locate Instructional Visual Answers by Asking Questions","version":2},"cited_work":{"arxiv_id":"2504.15918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15918","snapshot_observed_at":"2026-08-06T19:55:41.494044Z","title":"Ask2Loc: Learning to Locate Instructional Visual Answers by Asking Questions","venue":"cs.CV","work_id":"b05ee377-1963-4a1a-b7a5-ce83410aeae4","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.858859Z"},"links":{"cited_paper":"/paper/2504.15918","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:adccb5155512582b8108e6d5756f84c67abc5fb87be2e03224c05c616876471b","observation_id":"88150503-529d-4efc-a184-218b1afd31e3","resolution":{"observed_at":"2026-08-06T19:55:41.566893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.476914Z","title":"Dense-captioning events in videos","venue":null,"work_id":"e3ff9b10-73a2-40d9-ba2b-52333e67d726","year":2017},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.864125Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:8a81b12122dfd13475812d67304281103d6414b43c2d3e9780705a09de63f5fe","observation_id":"61e1c16c-3f56-426a-b742-6e40a45e8ac0","resolution":{"observed_at":"2026-08-06T19:55:44.559761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.888905Z","title":"Towards answering health-related questions from medical videos: Datasets and approaches","venue":null,"work_id":"973679ef-4f46-4901-a095-058294a20f0c","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.886100Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:a05274a3f5f491c0ff0ac11d9379d8514bad1ec2d75fe356ad26d68209d72220","observation_id":"ebc40eaf-9248-4aeb-bb84-07ca8691b617","resolution":{"observed_at":"2026-08-06T19:55:44.021480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.718316Z","title":"18 Wangyu Wu, Siqi Song, Xianglin Qiu, Xiaowei Huang, Fei Ma, and Jimin Xiao","venue":null,"work_id":"6db9b5fe-1217-474a-8332-4f8cbde63433","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.894079Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:85077b0c79ed91416b4958c844b7ef93b48f59bef1b10293f5220fdf4f7f9fb5","observation_id":"f22ac4af-4eff-423e-8976-e0ea004ceb77","resolution":{"observed_at":"2026-08-06T19:55:43.777750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.589977Z","title":"19 Zhen Yao, Jiawei Xu, Shuhang Hou, and Mooi Choo Chuah","venue":null,"work_id":"dcc9de93-b8cd-46c1-8299-99cc2207029c","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.904604Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:c069be69c2354fc889e2c88d47a19fb6f116c564b522455ca43b91f3f64a62f9","observation_id":"9ccbc03a-aaf9-430f-88c4-4edd46f6cdb5","resolution":{"observed_at":"2026-08-06T19:55:43.646010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.205961Z","title":"Overview of the nlpcc 2023 shared task: Chinese medical instructional video question answering","venue":null,"work_id":"c06a2c88-d1bf-4001-b3d0-f052c718212c","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.931997Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:dcc613345e34902ae6d5ea6241048dc3b5bb22c67d72525643d70963feae2192","observation_id":"09da3542-cf8d-43d1-b446-3fa285a370ac","resolution":{"observed_at":"2026-08-06T19:55:43.298365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.945833Z","title":"24 Bin Li, Yixuan Weng, Qiya Song, Lianhui Liang, Xianwen Min, and Shoujun Zhou","venue":null,"work_id":"980eda9c-30b6-4f1e-991b-4219b33b03c0","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.939915Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:3d5dc349e331fc79ee905dc3b08479450b7ff9def5bda614933ebf1a43562212","observation_id":"77563452-5055-4816-bebd-e27259f64448","resolution":{"observed_at":"2026-08-06T19:55:43.049156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.765397Z","title":"25 Bin Li, Shenxi Liu, Yixuan Weng, Yue Du, Yuhang Tian, and Shoujun Zhou","venue":null,"work_id":"5190246b-4c4f-4a19-a7da-50b1e62c0e60","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.955363Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:00830db6165a2adccdc96757dd856155202c4277d8a20d504c5055860fba2065","observation_id":"9117250d-5134-4312-8b97-ee9f67768324","resolution":{"observed_at":"2026-08-06T19:55:42.846058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.608476Z","title":"FCMR: Robust evaluation of financial cross-modal multi-hop reasoning","venue":null,"work_id":"885b7755-5e06-484a-bba1-afa027fbfc7c","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.968361Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:7035014c01a1bfb810c359f31f9d753c1e60644d5d9c413ad44e2f7f929f7231","observation_id":"afd4d8b0-394e-4e57-bc29-8d4255a74d3d","resolution":{"observed_at":"2026-08-06T19:55:42.669923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.442216Z","title":"Rosenblum","venue":null,"work_id":"3c381876-2d9c-4057-90c5-3ef321c2eeab","year":2019},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.981325Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:a2bded735a719fa7cba82a423857c11eb785c3fe770fd1ecae3b207e8b6e663b","observation_id":"fd775883-6eaa-4203-9851-fdd29d733145","resolution":{"observed_at":"2026-08-06T19:55:42.503693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05423","last_updated":"2023-03-02T01:52:48Z","snapshot_observed_at":"2026-07-06T14:03:38.013152Z","submitted_at":"2022-10-11T13:04:59Z","title":"Learning to Locate Visual Answer in Video Corpus Using Question","version":4},"cited_work":{"arxiv_id":"2210.05423","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.05423","snapshot_observed_at":"2026-08-06T19:55:41.190600Z","title":"Learning to Locate Visual Answer in Video Corpus Using Question","venue":"cs.CV","work_id":"f65852e6-442b-449e-9960-463445242204","year":2022},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.006696Z"},"links":{"cited_paper":"/paper/2210.05423","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:21ace3706edbe88587d58289eb5a68dd18c2cefc675fc103b2f6683438de8e3e","observation_id":"abcad994-5377-4ac4-beee-cece2c0fd05e","resolution":{"observed_at":"2026-08-06T19:55:41.243092Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.115296Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"f374c99c-4111-4fb9-9e97-cf1156632ca5","year":2019},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.016707Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:a85118b1e34315adef70212ed29d3183c191df052841ec43991e89a89cf0fce4","observation_id":"959f91af-2469-4faa-9d74-095e315f53d7","resolution":{"observed_at":"2026-08-06T19:55:42.197129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T19:55:41.025430Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.025430Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:e84a52168331d9af4f2dc784c7b14916642e3cc9a74be69787297dc96c570d47","observation_id":"6e19e462-a9b6-4018-9333-7a59fa32c54d","resolution":{"observed_at":"2026-08-06T19:55:41.025430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:41.964504Z","title":"Sentence-BERT: Sentence embeddings using Siamese BERT-networks","venue":null,"work_id":"0f198ca7-ff9e-47c3-a09d-5e46a0b4e7a4","year":2019},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.065943Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:cb9be1323820977cfed8ce178b24a8feae5f5117513a9da00cde8b82fa45c328","observation_id":"47f8b8c1-3793-4033-abbe-22c06b1e2e3b","resolution":{"observed_at":"2026-08-06T19:55:42.046479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:41.838924Z","title":"43 Zhongzhi Chen, Guang Liu, Bo-Wen Zhang, Qinghong Yang, and Ledell Wu","venue":null,"work_id":"cc9e3247-73d6-4d4e-92b7-c0f4ae7ac3ce","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:41.094698Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:20f8f3994edc7b7e5b7f89049855177c4a15f742f49f25edf4b8e769b749fe50","observation_id":"b47a3d3b-b6cf-498d-824e-6139ffeb4266","resolution":{"observed_at":"2026-08-06T19:55:41.876846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.304320Z","title":"Learning to segment actions from visual and language instructions via differentiable weak sequence alignment","venue":null,"work_id":"eeb52068-ede5-4492-a5dd-e00c53e3030e","year":2021},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.869419Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:e804366a7b817ddfb395c81fc918114823f6835bf663bdb12f80da37ce0d7a99","observation_id":"1dbacb54-5993-45b6-bffd-af70585129a2","resolution":{"observed_at":"2026-08-06T19:55:44.376483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:42.287537Z","title":"29 Yixuan Weng and Bin Li","venue":null,"work_id":"41c974ee-fdfc-4c83-ad6c-15802aa632ae","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.997756Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:a794ffac39a8cec15a33b400d8d99d325e87809a6d92c1141ec7dad2d4202996","observation_id":"2c5f6c14-1043-4637-aa52-287ddd85ba81","resolution":{"observed_at":"2026-08-06T19:55:42.371022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13347","last_updated":"2023-10-20T08:22:56Z","snapshot_observed_at":"2026-08-05T04:29:31.007689Z","submitted_at":"2023-10-20T08:22:56Z","title":"NurViD: A Large Expert-Level Video Database for Nursing Procedure Activity Understanding","version":1},"cited_work":{"arxiv_id":"2310.13347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.13347","snapshot_observed_at":"2026-08-06T19:55:41.338547Z","title":"NurViD: A Large Expert-Level Video Database for Nursing Procedure Activity Understanding","venue":"cs.CV","work_id":"d91e31bb-26a8-4b88-88ca-07b73ec4cf05","year":2023},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.879906Z"},"links":{"cited_paper":"/paper/2310.13347","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:6e461905d4751ec500c1db4b76f9db9d8230d9350414563c60b7f877d33598f7","observation_id":"473ed0fc-616c-46b1-a6b0-c80447ec3472","resolution":{"observed_at":"2026-08-06T19:55:41.397567Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.099262Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"cb2b9373-7b39-41f5-886c-7dd4e1db7a43","year":2020},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.874654Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:18e49d8002c6237d2aae6b4228d41e5126a1c6dbdde1149065b0419216d43a45","observation_id":"e78c0636-7dc6-45ad-8a77-2beb9fe0786f","resolution":{"observed_at":"2026-08-06T19:55:44.194492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:43.409703Z","title":"Buch, Cristobal Eyzaguirre, Adrien Gaidon, Jiajun Wu, Li Fei-Fei, and Juan Carlos Niebles","venue":null,"work_id":"d8738fc2-7ffd-4c36-89bd-5800e84564f3","year":2022},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.918432Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:faa1600e4636f99c0325fa2d4a77156f2e02dc1dd30907c5eb4b1f4603d51d48","observation_id":"b1f7998a-f06c-4a11-8ce7-f89296260b84","resolution":{"observed_at":"2026-08-06T19:55:43.500908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:44.844768Z","title":"Sci China Inf Sci 16 5 Xingjian Diao, Chunhui Zhang, Weiyi Wu, Zhongyu Ouyang, Peijun Qing, Ming Cheng, Soroush Vosoughi, and Jiang Gui","venue":null,"work_id":"3bfa2335-7325-4278-a967-7ecadecf854c","year":2025},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.837430Z"},"links":{"citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:f7069a9a801d8a6261af73caa478ef5964c2cf6b91aca133d125c60d00185281","observation_id":"fec5053b-15a4-418f-8b56-792bc45af0a3","resolution":{"observed_at":"2026-08-06T19:55:44.923865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02851","last_updated":"2024-11-05T06:49:14Z","snapshot_observed_at":"2026-07-06T19:45:21.541944Z","submitted_at":"2024-11-05T06:49:14Z","title":"Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization","version":1},"cited_work":{"arxiv_id":"2411.02851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02851","snapshot_observed_at":"2026-08-06T19:55:41.663672Z","title":"Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization","venue":"cs.MM","work_id":"2bf20d62-b1a1-49da-a6ca-87f5c76bef8f","year":2024},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.853738Z"},"links":{"cited_paper":"/paper/2411.02851","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:2cb3dd4355377044ac7ce790f11faf9e00eb9b2fa75895744963a83535ea18a5","observation_id":"ae9b021d-1696-414d-a9a4-0abf85f939f4","resolution":{"observed_at":"2026-08-06T19:55:41.732422Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04606","last_updated":"2025-06-11T04:23:47Z","snapshot_observed_at":"2026-07-06T20:18:16.913397Z","submitted_at":"2025-01-08T16:41:31Z","title":"Enhancing Low-Cost Video Editing with Lightweight Adaptors and Temporal-Aware Inversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04606","snapshot_observed_at":"2026-08-06T19:55:40.843380Z","title":"6 Yangfan He, Sida Li, Kun Li, Jianhui Wang, Binxu Li, Tianyu Shi, Jun Yin, Miao Zhang, and Xueqian Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:40.843380Z"},"links":{"cited_paper":"/paper/2501.04606","citing_paper":"/paper/2507.04289"},"observation_digest":"sha256:a4e56c897ead179b2847fc4b6dc4d754911997f73ea9b77d660e554cde166b28","observation_id":"f3f3491b-2274-4d88-86c8-02bebe49370f","resolution":{"observed_at":"2026-08-06T19:55:40.843380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04289","last_updated":"2025-07-06T08:14:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:49:02.071992Z","submitted_at":"2025-07-06T08:14:35Z","title":"M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2507.04289."}