{"as_of":"2026-08-11T19:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2279b70468725e373c033863385260f79a5d2c3fd6fb2a615ae9942f8994f312","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:34:12.380805Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T08:04:15.238840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T20:46:13.641295Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07972","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2f3a5ebf-3a04-4e6e-b1a0-61bbd8f4c7f7","year":2025},"citing_paper":{"arxiv_id":"2604.23198","last_updated":"2026-04-25T08:09:31Z","snapshot_observed_at":"2026-08-10T23:28:22.417916Z","submitted_at":"2026-04-25T08:09:31Z","title":"StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T08:04:15.238840Z"},"links":{"cited_paper":"/paper/2501.07972","citing_paper":"/paper/2604.23198"},"observation_digest":"sha256:f89ae62bd9359d1fe22f7867fb107e0a604b8726c84ac263c064adfbcdb25c77","observation_id":"5a7677e6-bf89-4d80-83a9-4868eded77a7","resolution":{"observed_at":"2026-05-11T20:46:13.644297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.07972/citation-record","integrity":"/paper/2501.07972/integrity","json":"/paper/2501.07972/citation-record.json","paper":"/paper/2501.07972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:12.066631Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.066631Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:d954d28d472b93c29b2cd2084f551c0b46e12b395e6148ec70f4e4a313c887b6","observation_id":"fb0021c3-7c2e-4226-b390-b98dcebf3366","resolution":{"observed_at":"2026-08-10T20:34:12.066631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:12.071863Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.071863Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:8effc8b593d9e780443f7578afd3865c7ef9cf4878bfa2fd334ce5b1c882a05c","observation_id":"e44a10ad-2c5c-464e-aa7b-e04dc8a9ec1c","resolution":{"observed_at":"2026-08-10T20:34:12.071863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:12.076756Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.076756Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:f4138afe461bd884ff60f3a72e23ff1aab4bdf241e26cdad010c5a4039dca572","observation_id":"256b286e-7b4b-4f0d-bf7f-272b2363632a","resolution":{"observed_at":"2026-08-10T20:34:12.076756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.637383Z","title":"P.; Barbu, A.; Siddharth, N.; and Siskind, J","venue":null,"work_id":"00ff6b77-4ac1-49f6-8d99-de5b5ce7d4f8","year":2015},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.080865Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:102af60e0b02769f493349742cd53fd14dea8155a06260d8455d3acb4bf5f8c9","observation_id":"f62c59b1-e218-4679-92a6-b9f430b5341e","resolution":{"observed_at":"2026-08-10T20:34:13.641916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.623395Z","title":null,"venue":null,"work_id":"a7df72c5-77df-42b7-ae98-b305999af852","year":2015},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.085047Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:d3b75f8ba0441e77ef516b1e37e56385ba4123aea1b71fd300a322dff8e7ed80","observation_id":"e7f76639-f72c-4e54-8acc-9ec4aa645a16","resolution":{"observed_at":"2026-08-10T20:34:13.627790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.609072Z","title":null,"venue":null,"work_id":"95a355f9-b157-45d8-88ee-7f151730647e","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.089625Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:f2b54482e6a2831dadb1834e00632ac9af2db6246e4b8f75686f5cffb0a0fabe","observation_id":"354051e0-70cd-4afa-9cf8-4a188aa44120","resolution":{"observed_at":"2026-08-10T20:34:13.613611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.595560Z","title":null,"venue":null,"work_id":"066003a7-f936-42af-9475-c011f40c679f","year":2019},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.093835Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:fdf85fa82159a48e76a2049f7d1e0d4ef545652c12741d7b75ca68e44bf53ceb","observation_id":"475e4609-9f6e-4c7f-be20-e8f98c26067c","resolution":{"observed_at":"2026-08-10T20:34:13.599636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.581834Z","title":null,"venue":null,"work_id":"c391acbb-a8e1-4bc8-8c08-0272f314dc6b","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.097724Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:0c95f1025f9227976f2b6a4783d9cf646559af0dcdbcfbdd5e777c574c884ab0","observation_id":"1ee15398-4f56-4c2f-b5b6-df58f1b47963","resolution":{"observed_at":"2026-08-10T20:34:13.586371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.568615Z","title":null,"venue":null,"work_id":"b6cd81e5-2437-4a32-a824-2469670206d9","year":2017},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.102567Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:3879b9e5ccb24202510c0780df0846a71669f708e3ec380b914765bb4bc8cd98","observation_id":"9200590c-8c4d-4085-b5b2-cdf08cc705ce","resolution":{"observed_at":"2026-08-10T20:34:13.572804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.554423Z","title":null,"venue":null,"work_id":"7f9fc0f4-4c0a-4147-8366-14249d952a23","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.106505Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:1e64282ef0c1e8cb229f376da2c27d5f83cbfb8ff2f35e7f8c8923a3822cfa21","observation_id":"4216065e-0ec8-4eea-81c2-0698470bd880","resolution":{"observed_at":"2026-08-10T20:34:13.559501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.539494Z","title":null,"venue":null,"work_id":"ae2d8d6d-c961-4d26-930d-bf0b68a53dd9","year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.110455Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:2ef2057b2510d68d39f6c6a8425a25a49a99e0368853e11dff57e41dd8b8aeac","observation_id":"341aa8f8-17dc-46ac-b682-7d2ea043de2b","resolution":{"observed_at":"2026-08-10T20:34:13.544573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T20:34:12.114574Z","title":"J.; Shen, Y.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.114574Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:6760932179745fae86f0575d63de8b1630b71aed870738bb74be53787481380c","observation_id":"f71b0f06-2866-4329-9828-ed021470ece7","resolution":{"observed_at":"2026-08-10T20:34:12.114574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-10T15:33:28.922197Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-08-10T20:34:12.119139Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.119139Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:7af5dfebe69a0547af88376e166df5882bc787fc9c91b2376bad97ca6c1897dc","observation_id":"e58aa81d-d6a3-4345-8de6-d4d17cd0e4bd","resolution":{"observed_at":"2026-08-10T20:34:12.119139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.524700Z","title":null,"venue":null,"work_id":"92f57a22-1215-4bb5-9e97-804862574b6b","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.124061Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:ee3148b5092d13c7320b997335b6b47f3742e24d4e8cedf7583cbd09c43c9807","observation_id":"2d7acad3-f351-4d19-97b7-78b8d8969e8f","resolution":{"observed_at":"2026-08-10T20:34:13.530139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T20:34:12.128101Z","title":"Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.128101Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:e65ef20859ef2f8507e005534c46d1dfb5bd034d0e535981035e08d16419affb","observation_id":"4001ef24-17d0-4fee-be60-91c001cfca63","resolution":{"observed_at":"2026-08-10T20:34:12.128101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.511101Z","title":null,"venue":null,"work_id":"a1f433ea-48f0-48c8-a909-7543c9cd826e","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.132520Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:22a086f36ff500e252a6d05af7ecccb73c6d1434b1a1c3430aad3160fb4e2c72","observation_id":"9dde5a58-fa2b-401d-8d59-da131baf827b","resolution":{"observed_at":"2026-08-10T20:34:13.515433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08189","last_updated":"2024-06-10T13:46:22Z","snapshot_observed_at":"2026-08-01T03:14:53.163224Z","submitted_at":"2024-01-16T08:04:50Z","title":"PRewrite: Prompt Rewriting with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08189","snapshot_observed_at":"2026-08-10T20:34:12.136449Z","title":"A.; Zhang, M.; Mei, Q.; and Bendersky, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.136449Z"},"links":{"cited_paper":"/paper/2401.08189","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:86d90c657ad0827b4c027176840b39920ea17a84fa0a6cb6396ad6b7fb2967b1","observation_id":"6a5e672e-5b5e-4369-96b3-02660bf66d75","resolution":{"observed_at":"2026-08-10T20:34:12.136449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.496880Z","title":null,"venue":null,"work_id":"cfee571e-6ca5-42ec-8a88-4c392823e518","year":2017},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.141179Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:bb7845f5d6da53d8edaffe33b706cdf35ec9afaee7b26aaf6d9f067bdf4e4a97","observation_id":"534b0871-4796-4346-8ee2-a7ddffb4979a","resolution":{"observed_at":"2026-08-10T20:34:13.501348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.483225Z","title":"L.; Boucher, A.; Thonnat, M.; and Bremond, F","venue":null,"work_id":"2a637a1d-3ffc-4cda-a959-18976dc38ebf","year":2010},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.145626Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:ac0a0a77ffba1ac04107e3fd91ac7e15dc4b8e291341460cb5f1b1162ebf236a","observation_id":"ccedf17e-7969-4c15-a7f9-0cff9f81fec0","resolution":{"observed_at":"2026-08-10T20:34:13.487457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.470539Z","title":null,"venue":null,"work_id":"622d26b8-4ca5-4eeb-b962-e8e4b8b71f45","year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.149872Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:86187f94b20351f5adcf6eda7ebdf074015c3b0b1818244be7b5b9cbe77e2d7e","observation_id":"f9e36f95-3e00-483b-a269-701e34f37ab9","resolution":{"observed_at":"2026-08-10T20:34:13.474511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-10T20:34:12.153968Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.153968Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:62af9f921bb3c7eb6be863c7f2929738bb3beacd9055525484ab9c955eb1561d","observation_id":"fcb0160e-5e32-49a8-a623-d83cd0bf444a","resolution":{"observed_at":"2026-08-10T20:34:12.153968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T20:34:12.159521Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.159521Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:df6d7a21c2de74b1d5d12c253e755dc541c15325e87a7e2a8ca6cbe09dab21e0","observation_id":"5a6e88d5-6b6b-4b5e-8c8d-597058c38908","resolution":{"observed_at":"2026-08-10T20:34:12.159521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13049","last_updated":"2022-03-28T14:22:18Z","snapshot_observed_at":"2026-08-05T12:22:26.874675Z","submitted_at":"2022-03-24T12:55:23Z","title":"Compositional Temporal Grounding with Structured Variational Cross-Graph Correspondence Learning","version":2},"cited_work":{"arxiv_id":"2203.13049","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.13049","snapshot_observed_at":"2026-08-10T20:34:12.718510Z","title":"Compositional Temporal Grounding with Structured Variational Cross-Graph Correspondence Learning","venue":"cs.CV","work_id":"0dbada20-6354-494c-b5b9-6129f6666668","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.164266Z"},"links":{"cited_paper":"/paper/2203.13049","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:9a5400f2de39de26db8c9c7a1a31e9ff5a3c8e84a985f6c4da992ce3d71f6d66","observation_id":"567dc82d-b37b-4e58-8ad0-209589aac924","resolution":{"observed_at":"2026-08-10T20:34:12.724034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.457559Z","title":null,"venue":null,"work_id":"1b854990-45d3-4696-83c1-78edf6deff68","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.168888Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:8a4a5a19a890fa62f993051ae96f2d2d5a0222c6cd44315cebd1706e6b44171b","observation_id":"d84538eb-e0bf-4167-b794-8e12bcfdf1fe","resolution":{"observed_at":"2026-08-10T20:34:13.461827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02869","last_updated":"2023-10-11T10:03:08Z","snapshot_observed_at":"2026-07-06T15:50:57.218090Z","submitted_at":"2023-07-06T09:12:13Z","title":"MomentDiff: Generative Video Moment Retrieval from Random to Real","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02869","snapshot_observed_at":"2026-08-10T20:34:12.173111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.173111Z"},"links":{"cited_paper":"/paper/2307.02869","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:e0f768342f90b1b980b4891177820719bbd69c6797e04bf6b1b702b52b1aeda9","observation_id":"b1617b5a-556e-4091-b76a-d87ffedb67bc","resolution":{"observed_at":"2026-08-10T20:34:12.173111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-10T20:34:12.177877Z","title":"D.; Gunasekar, S.; and Lee, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.177877Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:f819d4854dd36ecf091aaa52117b69e51972176041c20d1aec444bfee1d743be","observation_id":"62e9dc9a-f0c0-4840-8834-9d26300576d1","resolution":{"observed_at":"2026-08-10T20:34:12.177877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-08-10T19:32:21.161096Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-10T20:34:12.183271Z","title":"T.; Huang, Z.; and Wang, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.183271Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:c253263255d7865c80f9f2085c2470d0e3cfa34016499c9f9dcf5a3e3547af31","observation_id":"ad25aa30-b5fc-45f2-95f3-8f47d4e9f884","resolution":{"observed_at":"2026-08-10T20:34:12.183271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.443990Z","title":"P.; Li, I","venue":null,"work_id":"0691d8f6-ef79-4e9e-bf02-848cde11e09d","year":2020},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.188027Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:cb74c969fc0d1e72fc300f14acee1e9a470b96517aa8792d4cf47fe2ef07f5a3","observation_id":"d1ef7dc2-1c70-416c-b6ba-d3313644d97f","resolution":{"observed_at":"2026-08-10T20:34:13.448381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.429256Z","title":null,"venue":null,"work_id":"87bd1ea4-d43d-498a-908d-1836ed35ce11","year":2001},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.192599Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:f969b1c04cc1ee7a4d16c8ff722b890d50df78d891a699dec9f89402f0168638","observation_id":"6dd683d1-f39d-4b20-99fa-4265d52939cd","resolution":{"observed_at":"2026-08-10T20:34:13.434061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.413316Z","title":"Q.; Zhang, P.; Chen, J.; Pramanick, S.; Gao, D.; Wang, A","venue":null,"work_id":"cfc839f7-2c46-408f-b3d3-c495a99cf3e8","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.197423Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:cc7d0d3addf701e49233f1b0a9879d22b90b50eab169b1857df8b2ea1eaf6bf8","observation_id":"4646c320-7b55-4656-8de8-15a77f2df0a6","resolution":{"observed_at":"2026-08-10T20:34:13.419202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.397810Z","title":null,"venue":null,"work_id":"54f26957-7711-48a4-8d80-4508bd453b0b","year":2004},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.201320Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:568eb3f9eebe80b4085b5d5913b8de42ffa0d914e2c6a45e582f441997f2aaf8","observation_id":"15cc9d1f-c670-492b-946e-75cea26f841f","resolution":{"observed_at":"2026-08-10T20:34:13.403672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.381271Z","title":null,"venue":null,"work_id":"a6fd0831-e298-4936-a946-57843409af18","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.205355Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:0268fbbd5d78f3515f7897004db19eac68fd4459a93945dc3a541376b2380efb","observation_id":"d4d1c1a7-0dbc-41a4-af50-184eff5b7e51","resolution":{"observed_at":"2026-08-10T20:34:13.386471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-10T20:34:12.209489Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.209489Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:2c6e6bf32b68ee9d6f5e1880408c165de54d32a30b1552988e61fa4f9f775f62","observation_id":"78f3c9e6-614a-4baa-bba7-9ce3c7d50168","resolution":{"observed_at":"2026-08-10T20:34:12.209489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.365854Z","title":null,"venue":null,"work_id":"db08d361-9e93-4356-a0f0-0a5a1f9904c5","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.213492Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:24bfc03395cdfe81dbdcea2ec46b09d834fe1aaefd402cf029299c4458bf7064","observation_id":"26db8e28-8088-4bc1-86a5-b1dbed7fe11d","resolution":{"observed_at":"2026-08-10T20:34:13.370695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08632","last_updated":"2025-03-03T12:01:27Z","snapshot_observed_at":"2026-07-06T17:44:00.848335Z","submitted_at":"2024-03-13T15:46:37Z","title":"A Decade's Battle on Dataset Bias: Are We There Yet?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08632","snapshot_observed_at":"2026-08-10T20:34:12.217303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.217303Z"},"links":{"cited_paper":"/paper/2403.08632","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:3b6dfbd2bf5451906b510a6cbf46c5e95d96e3d52bc3abb913b79a6b02e22f5c","observation_id":"c9898231-9276-4cce-ac0d-11391c98d873","resolution":{"observed_at":"2026-08-10T20:34:12.217303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00661","last_updated":"2023-09-01T13:06:50Z","snapshot_observed_at":"2026-08-09T11:13:58.678743Z","submitted_at":"2023-09-01T13:06:50Z","title":"Zero-Shot Video Moment Retrieval from Frozen Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2309.00661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00661","snapshot_observed_at":"2026-08-10T20:34:12.628110Z","title":"Zero-Shot Video Moment Retrieval from Frozen Vision-Language Models","venue":"cs.CV","work_id":"6bae7df1-92bc-4d6b-b87a-d837f42bb75e","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.225371Z"},"links":{"cited_paper":"/paper/2309.00661","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:d3013b706d5b075ed142ea06711abf5dd3bcb8482728921ca509a72a06e87805","observation_id":"2851c0cd-cf46-4625-a8ec-cce3431106d4","resolution":{"observed_at":"2026-08-10T20:34:12.632794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.351454Z","title":null,"venue":null,"work_id":"7da47353-229b-49c8-8871-2d8e8bd03d69","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.229853Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:9575b54e2e244e1857c6bd63d1603505ee8c94336ed8ac57ac2fc6f99d9474fa","observation_id":"a18c8819-7e3d-466c-8eda-2fe5167fbee2","resolution":{"observed_at":"2026-08-10T20:34:13.356075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.335508Z","title":null,"venue":null,"work_id":"54953777-f6fe-4ba7-aa20-67ff18d77ac5","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.233983Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:1c00fcdbaa89ee22ba2fb4713686d86b4b63ace94b8c3b40611df77b0fccfff2","observation_id":"de6bfcff-74cf-47a4-964d-a951a54c7990","resolution":{"observed_at":"2026-08-10T20:34:13.340938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-10T20:34:12.238406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.238406Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:af066b3e964ebbccc1f1075c5f98c2846cb49c80ff9fa8f4ef90ffd8451c4fce","observation_id":"23494253-3ef8-48da-8657-7cd744aad1f5","resolution":{"observed_at":"2026-08-10T20:34:12.238406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10687","last_updated":"2024-02-20T20:07:16Z","snapshot_observed_at":"2026-08-09T06:37:00.924638Z","submitted_at":"2023-09-16T00:55:08Z","title":"EchoPrompt: Instructing the Model to Rephrase Queries for Improved In-context Learning","version":3},"cited_work":{"arxiv_id":"2309.10687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10687","snapshot_observed_at":"2026-08-10T20:34:12.593654Z","title":"EchoPrompt: Instructing the Model to Rephrase Queries for Improved In-context Learning","venue":"cs.CL","work_id":"271f800e-bf10-42bb-8029-3a62b94a57a9","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.242702Z"},"links":{"cited_paper":"/paper/2309.10687","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:d9e07b0cfdaa5a2bda8f267b9e05574ec63a9de52c75ea49156b5cfe3b04d1fa","observation_id":"2447d950-2d0a-439d-80cc-938121226d20","resolution":{"observed_at":"2026-08-10T20:34:12.598679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.321117Z","title":"J.; and Choi, J","venue":null,"work_id":"7fdc9d3f-de93-4b3d-9934-38225a6ca036","year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.247269Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:6057992dea7aed28a4c5ae046737f9e050a6167ab12556b4c4cfb6976c6b59b0","observation_id":"16503e9a-1446-43ca-8596-b72eaaeee85d","resolution":{"observed_at":"2026-08-10T20:34:13.326167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.306395Z","title":null,"venue":null,"work_id":"c9edfd26-289b-4aa1-b8b0-4c5f4423cb3d","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.252417Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:26e9d705ac43f87dcbef25fdd186abcdb6e0a3e390c89075e6561aeb2d2566f3","observation_id":"2f05673b-b2a0-435c-a483-ddfa0591363e","resolution":{"observed_at":"2026-08-10T20:34:13.311258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:12.256532Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.256532Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:1719fedbeceeedf0bf7f52dcee678b410b39d80bca44d5f6adff030180d31eef","observation_id":"4cc89b0c-f4cb-4ddc-9ebd-f9e1be9e3014","resolution":{"observed_at":"2026-08-10T20:34:12.256532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.281320Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; and Clark, J","venue":null,"work_id":"501c3021-6488-4cc0-ab68-2cc3a62542d4","year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.260172Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:15d1feffec1c240b0a528402e9982a48515ec168eb3be533c4461223ed5131cd","observation_id":"edcc05da-973e-48c1-878c-7eebc40cc71d","resolution":{"observed_at":"2026-08-10T20:34:13.286779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-10T20:34:12.264313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.264313Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:711d32d979a473a0fa3b4719be921104e3d21dfa5b5f1aeacecef8ebcc5d7a71","observation_id":"1124415d-0c4b-421a-a124-df65e9d5acbc","resolution":{"observed_at":"2026-08-10T20:34:12.264313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.267989Z","title":null,"venue":null,"work_id":"184c86c9-4158-40da-b18f-eadea1e802b1","year":2013},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.268853Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:5d219f942aa4ac719546de20e6044d9bf3f023c93b85f03f3ab937a62a4ca1f3","observation_id":"64041b5a-36fc-49bd-ba5d-ddef00691532","resolution":{"observed_at":"2026-08-10T20:34:13.272366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.253863Z","title":null,"venue":null,"work_id":"b9acfdcf-1b09-4578-b938-32d1d9c2f714","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.273729Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:03b7f053ecc707f75d3d462ce42a1215698316290718cd3d98029423dad7e415","observation_id":"6904b105-b3df-446a-a7e6-7c6644003076","resolution":{"observed_at":"2026-08-10T20:34:13.258861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.239856Z","title":"A.; Varol, G.; Wang, X.; Farhadi, A.; Laptev, I.; and Gupta, A","venue":null,"work_id":"4940fb38-0e68-4c5c-8a9b-576ef2a2e4e5","year":2016},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.277668Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:899ef0bddc007e7effd9bf5c72af691a1e0fdcc998e9d87508c87f13ece928b7","observation_id":"d7b3be0f-b2aa-44df-acbe-4c35fd017854","resolution":{"observed_at":"2026-08-10T20:34:13.245005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.225205Z","title":null,"venue":null,"work_id":"83d370e7-2910-471f-a2c4-6f772f158eef","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.281819Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:00133a7810981fe6452e0bbc51dbe3a32d7cbc37c68f71bf2d90146e67c548cd","observation_id":"b6227838-ef75-4d96-85c1-c5ab9192aeac","resolution":{"observed_at":"2026-08-10T20:34:13.230476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T20:34:12.285898Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.285898Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:d5faee2bd5bbc5ff7d34b07643f944f905d14626a1e7b515415a93dc0e825320","observation_id":"85c11104-1f9a-48c2-99be-a9f8211a461f","resolution":{"observed_at":"2026-08-10T20:34:12.285898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.210491Z","title":null,"venue":null,"work_id":"15f39016-7737-45bf-b102-0b3d63da480f","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.290110Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:5f65346dc7c64ea9fbd29c25ee9e06169196691a4dfcdb64e76c93f33aa9eab2","observation_id":"77d8f6fa-b86b-4c5d-b16b-eb4f4c8db116","resolution":{"observed_at":"2026-08-10T20:34:13.215687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T20:34:12.294304Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.294304Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:b77c11fe94e320cf480cb41fe679c3003875dce671866f61e134c7d8920d6164","observation_id":"3a3acdbf-0840-45e7-9e6a-ed3fd685817b","resolution":{"observed_at":"2026-08-10T20:34:12.294304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.196596Z","title":"I.; Shekhar, S.; Döllner, J.; and Trapp, M","venue":null,"work_id":"f3530d47-678d-4b8e-9215-1ff78cbde03c","year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.299217Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:b3e8384023abd0cd922fa1a543ff74d9795471059e9e32ec218a814dacb570aa","observation_id":"98dac2c9-f977-490e-9d23-9f728e17f3f6","resolution":{"observed_at":"2026-08-10T20:34:13.200998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.182799Z","title":null,"venue":null,"work_id":"c21ca124-20e4-4837-8e39-6b1ea74d9c5d","year":1972},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.304047Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:1ea54676eed1ab794404085d98dd26fb91c1a179fa73dad0b9bed5c7c086456f","observation_id":"b5f4950f-96b1-40fa-a02f-dcfcb035865e","resolution":{"observed_at":"2026-08-10T20:34:13.187209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.169541Z","title":null,"venue":null,"work_id":"f564f2aa-e93a-4fb4-8acd-dc90047a22fc","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.308515Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:ce3a066e4fee2208de47b7f62be1c4ba4a0387543fe606793e7118cf68e2d550","observation_id":"b94c84d3-0ad5-4d41-a48c-53ca696762b6","resolution":{"observed_at":"2026-08-10T20:34:13.173735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04344","last_updated":"2025-02-14T09:51:46Z","snapshot_observed_at":"2026-08-09T13:35:45.821715Z","submitted_at":"2024-06-06T17:59:56Z","title":"Verbalized Machine Learning: Revisiting Machine Learning with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04344","snapshot_observed_at":"2026-08-10T20:34:12.312879Z","title":"Z.; Bamler, R.; Schölkopf, B.; and Liu, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.312879Z"},"links":{"cited_paper":"/paper/2406.04344","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:e5949eda0ab645e6f6862196af260ffcaac9ee27be07755cece675ddf32e3542","observation_id":"24aa0b82-dbdb-4180-acbc-fe1b5b4018c6","resolution":{"observed_at":"2026-08-10T20:34:12.312879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-10T07:58:15.209421Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-10T20:34:12.317250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.317250Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:1f0504d4f73c6bd48c05f9211ba1ba433c46d9ade0952e2c0a69f25ddf7974a0","observation_id":"518124bb-2ea9-4932-9a99-69a269d6c651","resolution":{"observed_at":"2026-08-10T20:34:12.317250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.155548Z","title":null,"venue":null,"work_id":"9e930765-f46f-473d-bd0f-4490c82e12f3","year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.322375Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:4f7c632b5f7f7595161271e95970910069156f0a8c8c8823d1285f651329af2b","observation_id":"eea02911-4dcc-4ddc-9a8c-bd32712ba69f","resolution":{"observed_at":"2026-08-10T20:34:13.160053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.141573Z","title":null,"venue":null,"work_id":"83d10755-a7a4-4dd1-a807-b500cbd8249e","year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.326799Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:69654b8d6ab8e80ab1263bb4dfce6681eea577311667724d21ff3e73928f98a4","observation_id":"eb513a00-d938-4e95-a1f6-32ce3112111c","resolution":{"observed_at":"2026-08-10T20:34:13.146154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.127584Z","title":null,"venue":null,"work_id":"c33c18d2-a395-403c-91a8-9aeac05f22b6","year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.330949Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:16c51349634c9794813482a2c1fd2774138e10c8c507f28f217376c9c010f3d5","observation_id":"fb4765d7-7ccf-448e-94e7-52c2f2e3ee16","resolution":{"observed_at":"2026-08-10T20:34:13.131776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.111753Z","title":null,"venue":null,"work_id":"360877a1-55a2-48e5-abba-a915e372b1a3","year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.335292Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:858ed45c68b07f1456c20f5e455a5b5a388e899f6d7ec7bd36346e691986cc5e","observation_id":"affab108-7f76-47c3-94bf-f5635e06cc81","resolution":{"observed_at":"2026-08-10T20:34:13.116393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.097422Z","title":null,"venue":null,"work_id":"e0dc74a1-f9b3-48ac-a2f8-8c3e841ec676","year":2025},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.339630Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:8892e5b3268d433f8ff7b5d764dcbb11070669fa810aaca976f20bcb4d2bac3e","observation_id":"23ca5529-515a-4211-8570-aa374c9c0571","resolution":{"observed_at":"2026-08-10T20:34:13.101752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13657","last_updated":"2024-04-21T13:25:46Z","snapshot_observed_at":"2026-07-06T18:03:19.407231Z","submitted_at":"2024-04-21T13:25:46Z","title":"MLP: Motion Label Prior for Temporal Sentence Localization in Untrimmed 3D Human Motions","version":1},"cited_work":{"arxiv_id":"2404.13657","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13657","snapshot_observed_at":"2026-08-10T20:34:12.500074Z","title":"MLP: Motion Label Prior for Temporal Sentence Localization in Untrimmed 3D Human Motions","venue":"cs.CV","work_id":"5d00d6ac-7588-4351-80de-80b6c80b8a1d","year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.343810Z"},"links":{"cited_paper":"/paper/2404.13657","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:1de99e59404578d099b9ce442cc544e4e4c037bef3d4a61d9d04a001a977418f","observation_id":"5cd92ac0-2726-47ae-a61a-68860602a4e8","resolution":{"observed_at":"2026-08-10T20:34:12.505823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01534","last_updated":"2021-06-03T01:33:26Z","snapshot_observed_at":"2026-07-06T11:15:26.915483Z","submitted_at":"2021-06-03T01:33:26Z","title":"Deconfounded Video Moment Retrieval with Causal Intervention","version":1},"cited_work":{"arxiv_id":"2106.01534","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.01534","snapshot_observed_at":"2026-08-10T20:34:12.475538Z","title":"Deconfounded Video Moment Retrieval with Causal Intervention","venue":"cs.CV","work_id":"5177cfbe-2796-4ce9-b9de-9610ccd2d957","year":2021},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.348085Z"},"links":{"cited_paper":"/paper/2106.01534","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:7e0ac7a9105b8012945d4e694ae9cc0047ec3d1b2febf576cb2febb8a0565432","observation_id":"bbca617f-da0c-41cd-9517-d928f45d922c","resolution":{"observed_at":"2026-08-10T20:34:12.482895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14066","last_updated":"2025-02-24T03:32:32Z","snapshot_observed_at":"2026-08-06T11:42:35.714273Z","submitted_at":"2024-04-22T10:23:59Z","title":"SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14066","snapshot_observed_at":"2026-08-10T20:34:12.352313Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.352313Z"},"links":{"cited_paper":"/paper/2404.14066","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:95dc9d7031b195a650f17fe957cc9440926591fafefe6a28c1eb59e588da8a9b","observation_id":"d427661b-f2b3-4ea9-86d1-74dc420080bf","resolution":{"observed_at":"2026-08-10T20:34:12.352313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-03T02:27:58.110775Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-10T20:34:12.356485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.356485Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:c0f0c0ba4245aa642ff6f796a086b90440e4d08d34f7db748ee118ec97bde009","observation_id":"0c9c4cca-bfce-4f33-91ac-e5c0250cd23e","resolution":{"observed_at":"2026-08-10T20:34:12.356485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.082866Z","title":null,"venue":null,"work_id":"f323bcab-a958-48f2-b8ae-20e5611987ac","year":2020},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.360568Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:34b7bf1c76effb7a3534ac7a9193189c7232a6080793301d9b635f386a31ddd1","observation_id":"13f1873e-5f20-41ee-8448-5442652b193d","resolution":{"observed_at":"2026-08-10T20:34:13.087847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T20:34:12.364724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.364724Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:24114374a2565ce6abdae4546a56bd77264bd7a7971bf147e9aead01ae32fce9","observation_id":"b5009508-9f94-4d48-9ad9-a154b051ce08","resolution":{"observed_at":"2026-08-10T20:34:12.364724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.069047Z","title":null,"venue":null,"work_id":"c2e78d39-256d-4640-b030-1f23e0341eaf","year":2024},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.368702Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:4981695742b9fff6977b6be3dde4511dc94b8a945f9a864cb7ecece430837c66","observation_id":"dc36f000-4dae-40c2-828d-14639f1d93f6","resolution":{"observed_at":"2026-08-10T20:34:13.073445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.054815Z","title":null,"venue":null,"work_id":"3b146e68-b843-424d-a197-41bed6e7692c","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.372736Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:2f74117c023aa8dccca5b29693fda4985b942776fcb7bbf7726c1702ccca130d","observation_id":"19ace2d6-af39-4b42-8e56-d321ea147a70","resolution":{"observed_at":"2026-08-10T20:34:13.059507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:34:13.039305Z","title":null,"venue":null,"work_id":"f7bd2aa4-45eb-4b9c-a464-2bae62afffb1","year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.376826Z"},"links":{"citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:d12de59a8593f8b1a224119cba066fec89f66443893478095f64df1968a5194c","observation_id":"e03d85be-bf0b-49e7-820a-1643cae88297","resolution":{"observed_at":"2026-08-10T20:34:13.044474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T20:34:12.380805Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.380805Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:3337e27184bd8533f2057722aa52d1203517e6a2fb3dde074c4cffc55720abb2","observation_id":"f29df06d-4659-48c8-8685-279ab39d136b","resolution":{"observed_at":"2026-08-10T20:34:12.380805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":5,"verified_fuzzy":8},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2501.07972."}