{"as_of":"2026-08-20T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8502bff68a22283cf4e14305491cc6e02cd17283078a5db013204138fccf94a","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:27:37.631870Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T04:55:06.976425Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26104","snapshot_observed_at":"2026-07-31T04:55:06.976425Z","title":"EVIDENT: Routing mllm adaptation through entity-grounded visual evidence for cross-domain video temporal grounding.arXiv preprint arXiv:2605.26104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28516","last_updated":"2026-07-30T16:55:00Z","snapshot_observed_at":"2026-08-10T14:40:08.313631Z","submitted_at":"2026-07-30T16:55:00Z","title":"Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T04:55:06.976425Z"},"links":{"cited_paper":"/paper/2605.26104","citing_paper":"/paper/2607.28516"},"observation_digest":"sha256:36f94bb8f7eb648bc28fe99077155c41736f1ef58eceaafd3033860b2571e3ae","observation_id":"93dea148-fa54-486e-8d3b-e4901bff6b7c","resolution":{"observed_at":"2026-07-31T04:55:06.976425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.26104/citation-record","integrity":"/paper/2605.26104/integrity","json":"/paper/2605.26104/citation-record.json","paper":"/paper/2605.26104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Slot-guided adaptation of pre-trained diffusion models for object-centric learning and compositional generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:c1ef8d28d3e92d7565606457f7e041a3bb28ca9a91262259317275829061e0b3","observation_id":"59683863-dfe6-4790-90cf-304ea96d036e","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"DEVIAS: Learning disentangled video representations of action and scene","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:1b5c54acfeb1bd80cb6930b802b1513b682314996f7fe93a46cd77fee2ef9697","observation_id":"ee1662a8-c807-4b1d-9574-9151eccb8ddc","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:ff354d1043277f51d80ad421221fa5f50ead4257c669434d35e5db45bad87220","observation_id":"42fb294e-730e-4ae0-bbd1-03ff9f58cb1b","resolution":{"observed_at":"2026-06-29T22:34:01.977971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Learning sample importance for cross-scenario video temporal grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:5164d5ad2ea9e735004a327c03b7fac6e7b353da591b97296affd698bb24b00f","observation_id":"ca6b291a-1416-42c1-92f3-b15c87336c8c","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:4c851e694aa3be2d7058f4dd4cfba7eb299181516c7ad530f7a5d8ad99d76f9c","observation_id":"59ff1312-5ae6-4bc5-9370-b7f69fd956df","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Towards a complete benchmark on video moment localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:ab326dec6070ee9489be0463594c7e6972b575c8f00c5e9b66fe4f11cf66e120","observation_id":"fbceec8d-df5a-4211-b19e-211b24a6ccb7","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17726","last_updated":"2026-05-19T09:55:01Z","snapshot_observed_at":"2026-08-14T12:18:58.071383Z","submitted_at":"2025-05-23T10:43:45Z","title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2505.17726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17726","snapshot_observed_at":"2026-06-29T22:34:01.952554Z","title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","venue":"cs.CV","work_id":"3ceb15fa-9809-4d53-8833-dda0a5f6b08e","year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2505.17726","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:96b84529ae3d468f7a063def4656996a7531ee7fa0c5e1172d814ff2ea0f3f43","observation_id":"bf929a28-c1f6-430a-ab45-9b10808689cd","resolution":{"observed_at":"2026-06-29T22:34:01.955333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Learning phrase representations using RNN encoder–decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:834fef19eb3e68bcde9a7112c14f41f30d6de994fada37afcd99e21fdb6545da","observation_id":"47b534db-961d-412f-97cc-59f28e61395b","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Why can’t i dance in the mall? learning to mitigate scene bias in action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:673d87749d6fbf778613b000d079b02dbc388c855dafc08804824b4a010b0895","observation_id":"d8223d8e-54e0-4287-af27-dfc9a7d6fb93","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:9ec27bf0888880bd68e40b2540be4dab730e3f400bce597c64fe52d7378e0ba2","observation_id":"2fbd0d8e-10ef-4f2e-9984-be8c0e61d8e7","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05643","last_updated":"2025-03-03T10:28:30Z","snapshot_observed_at":"2026-08-16T13:11:41.243735Z","submitted_at":"2024-10-08T02:46:30Z","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","version":3},"cited_work":{"arxiv_id":"2410.05643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05643","snapshot_observed_at":"2026-07-02T12:16:57.678370Z","title":"Trace: Temporal grounding video llm via causal event modeling","venue":null,"work_id":"b2af5095-2950-48b5-af5e-270218b8d041","year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2410.05643","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:04b55e26ab6c7a09fcf0dd4d0b368321aac720b41a0b70595ec43234f1c24cee","observation_id":"c773432e-e090-455a-a8f9-3f7d01ba95db","resolution":{"observed_at":"2026-06-29T22:34:01.960099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Can shuffling video benefit temporal bias problem: A novel training framework for temporal grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:9c4898f3b10c7a2bcd8f9fbaec70d4dd2ce8a350e56a95af224b7a351282b31a","observation_id":"32172b78-bf7a-4188-a47f-1577be444464","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:d65115fd42a6129ea053528adf15a11a8d56ff2d34aa43d0234c208865d0c6bf","observation_id":"6e01abf9-6027-409d-be35-a7e42d180116","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:95f0a067c276fc0dec8850af3247f3a57d851a924008fc6d8b10cec27e64f49e","observation_id":"fc866930-3d4d-4710-bbb8-627b48dc0657","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:8658dc86d7167354499215c014d5c631e435bc5c51534e344c525ba463488b89","observation_id":"628cb1d9-ecfd-4888-841d-53da34c13bf6","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Knowing where to focus: Event-aware transformer for video grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:610ed65ca7a8d049de63f8abaa0a97ecce1577c5ed5e42009de284991d21cb03","observation_id":"8934bb89-a70e-4a81-abf0-8b0d91106f7a","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Transferable video moment localization by moment-guided query prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:cbeb9e9297ad4e38098379cb3391c8883973bb32d014a95ecdfc621b848cee32","observation_id":"723fb3c1-3723-4537-9fdc-98c5f7f3ef81","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Map the flow: Revealing hidden pathways of information in videollms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:23fe9e7c0e9066c142892f6dc05f8a72ad42a419674c150d9c915892a89a06fb","observation_id":"7f37e56a-b779-4a55-9f1d-30b5eff385c8","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Conditional object-centric learning from video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:65feeeef331a7692ae58e6387aa15a1339ed1e12f15971a02c14e2823828ef94","observation_id":"f65293df-07ed-496b-af53-97c37d82d410","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"The hungarian method for the assignment problem.Naval research logistics quarterly, 2 (1-2):83–97, 1955","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:01b8c8b8a74ba16b1b2357afa60d3deb902e7f57508de2990571edd883ad94b1","observation_id":"90325556-c64b-4282-aec6-8767828413cc","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Curriculum multi-negative augmentation for debiased video grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:39be088842cfe46110d041cf711fb0285a24a4e24d8e86622fe74e988ecbe4c4","observation_id":"a9563e9a-d80b-4fe2-838e-1ebef6ced8e5","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:e6065da4887f9c245e8c33b84da46fa5de3090135e8f9208e7a713bdc93271a1","observation_id":"8e7df4e1-3df4-4e26-b6fc-7ebe2ee5a836","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Revealing single frame bias for video-and-language learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:7c3a9773cf2bb67c2950abe5b9be57cceabb279d062859fbedec2ea517234e7c","observation_id":"7a692466-f2df-4439-ad39-88ed50ffa580","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"CORE: Compact object-centric representations as a new paradigm for token merging in lvlms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:1c7cf3b88f4ab3d9ed626875e97547d75188b50905de5c924b2e9de01a411db2","observation_id":"6a930184-552d-4f14-af62-27d77950007d","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Compositional temporal grounding with structured variational cross-graph correspondence learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:bf0f411c436d9e2725c1d4072b87ac7effb619b9408d8e0cc716420a9f18960e","observation_id":"69139d4f-7d97-4955-b23b-2f525af80212","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:6300f2ef56a92ef89441c017dfa0f8803d809431b93cbf53bef361d2a16f3b2f","observation_id":"375b91c7-9253-4990-8f70-83a7d18aff17","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Resound: Towards action recognition without representation bias","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:a808f5bf5fab2b2111ded0b045d5f64af0dc1c42b259152da7964fb71d43d353","observation_id":"b4fde34e-033f-4457-b21e-3363373f1183","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Universal video temporal grounding with generative multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:6857d8dd91d06fdb3172e030275d2428f0f8a43d485501fd9733db45b5b89748","observation_id":"a58bed83-be5d-4fbb-b9da-adf6d596d1ad","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:0bb434a6eac22205b9b7e99191d6569ad79b4a67b393f6b0a3979c3b86164553","observation_id":"d3ae0a3c-449e-4365-b218-ec2a3f80d7f8","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"VideoMind: A chain-of-lora agent for temporal-grounded video reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:1ccb507c3617792c01b0fa56b17c75d5dcf76a145cf30d513e8cc8cb091bfa20","observation_id":"cf46a071-579e-480b-8709-c60a25f820e6","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Object-centric learning with slot attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:2fc2e359747eff6ca6d26ab0246af09a8bf23f0651a8005e7603cf067cb24cf2","observation_id":"dc227c4b-e38b-488f-a021-43c351df4d89","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:bea23e9751f66b0ebf9098402c2833c1137f7bd100d2a97e534aeb847e0be9c9","observation_id":"cf459cf9-1452-4311-bebd-9f50e9d0e620","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Chrono: A simple blueprint for representing time in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:6fa70b063d9ad09450f7073bb92f443ea56bb8593c4bb0ed6bb95dcd0f03333d","observation_id":"379328b2-8db1-419d-8dd3-8b967bdd6c36","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-19T10:36:23.209538Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":"2311.08835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-07-04T03:29:31.161365Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding","venue":null,"work_id":"930bf918-21bb-485f-a9a4-7951c1ac3b74","year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:6a9d73d5c3d513aedcb5d9cf926150860be0c6350d15fa4489cbe1b86bde7057","observation_id":"2b763c0e-541e-4203-ac15-37ad7f6b8df7","resolution":{"observed_at":"2026-06-29T22:34:01.973699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Query-dependent video representation for moment retrieval and highlight detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:edc8ae5abc1c7a5a2c3f3046f04eca7eb1d4adbc771dbfe18347f3244f6a0018","observation_id":"b9b0e86b-e7df-4266-9ba5-d48756fc7982","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Interventional video grounding with dual contrastive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:7b9766bb3a0f68a67331d10eab13b130d07752341ee3bb66d130389c7596cdda","observation_id":"903db503-eafe-4923-ac4d-c891d729331b","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:b96c506e3f99dcc3fbe68094c144fafd787fa953ca0a710813394e2f63a784da","observation_id":"7dc02467-a97f-4efd-90a7-b3d1fd6c2fc8","resolution":{"observed_at":"2026-06-29T22:34:01.950495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.00325","last_updated":"2020-10-07T10:15:13Z","snapshot_observed_at":"2026-08-20T04:16:21.068208Z","submitted_at":"2020-09-01T10:07:23Z","title":"Uncovering Hidden Challenges in Query-Based Video Moment Retrieval","version":2},"cited_work":{"arxiv_id":"2009.00325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.00325","snapshot_observed_at":"2026-06-29T22:34:01.974229Z","title":"Uncovering hidden challenges in query- based video moment retrieval","venue":null,"work_id":"fe57bc1b-6c71-40dc-8566-99bd1b701dee","year":2009},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2009.00325","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:edd076bef93037d8d95acee8a206c0086b311fba6d2a3fb3f0e5122fdda5e7b9","observation_id":"b51c7ff8-b196-4780-89cf-a98431081e1b","resolution":{"observed_at":"2026-06-29T22:34:01.976448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Bias-conflict sample synthesis and adversarial removal debias strategy for temporal sentence grounding in video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:fd53d676e2209591a54796d55cf56c5268437ff20560e5d509ff9d497674a722","observation_id":"cf729709-b1e9-4dee-9b22-c2b0d07d5c1d","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:83f9c086a7367be8356d2902eca2d71d57de8e90983d3223eca319afb32304b4","observation_id":"e9f3256e-b22b-4bc8-ba66-51bf5bc7c03f","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:fc2125adbdcc186fd8f03c4035f37863a3a2f27f791a0e30d4a1cbc60ff9af05","observation_id":"8cef6afb-f290-4e59-85f3-8bf5e7a37f8e","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Tr-detr: Task-reciprocal transformer for joint moment retrieval and highlight detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:eb26c3a53ad042ed3075e695298f0838ac72b4e7c6229a2849992bb1e8057203","observation_id":"daea9e2a-da62-4bde-ab80-9c74af55d450","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Time-R1: Post-training large vision language model for temporal video grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:4d5b6632dd1bac885f22ec751ec017afc02b644023fed09070203fb42f8faa23","observation_id":"e5c6d972-d062-4d48-b9e8-16059f2fc499","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-20T04:16:20.384789Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":"2403.10228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-07-03T20:38:56.195732Z","title":"arXiv preprint arXiv:2403.10228 , year=","venue":null,"work_id":"fb2ec1aa-a3b0-43e2-9e93-2b73d3097074","year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:4d21915d2962bdfeb96f13dba6c6f8f9e53a2ea4cc8d4f65234ad2d5a8755b1d","observation_id":"25b9edde-1c18-4302-88f3-8f11480aea48","resolution":{"observed_at":"2026-06-29T22:34:01.972853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Slotformer: Unsupervised visual dynamics simulation with object-centric models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:0c87ca187a61eb5e112d75f81ba9329a436ebf52bffd8595a3068871184c3bec","observation_id":"17ffea0d-fa8c-4efd-988c-c7971b4bb70e","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Slot-VLM: Object-event slots for video-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:fec9280dd19351c312f651878cd761b4902f9b37008fd90390bb11ff2206e0df","observation_id":"1b828490-9ea3-452f-9aad-61a9a16dc715","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:302909db547c18ce9efa96c4a0fa09506f96c6a55c3249cd78cc8e7f61d16647","observation_id":"02957ce7-fc70-4ba5-9778-d81679611481","resolution":{"observed_at":"2026-06-29T22:34:01.968738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"AIM: Adapting image models for efficient video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:7cb8960eb02bbafed9c56363eec75302aa0ff601d24a16591d1d885d471537cf","observation_id":"a5deb9da-0e8e-4827-a1cd-22a3a734134b","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Deconfounded video moment retrieval with causal intervention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:eb16a408806f40348ae299d69ade0bdcdf7d671eb0bc9fb9985c91b686e9e15c","observation_id":"1f070caf-f161-4b0c-bdc8-da23cb92c6ad","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"A closer look at temporal sentence grounding in videos: Dataset and metric","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:052fad14e73edc756af5513c9ca06dbe96b989bda3c740dc00770d7812271bb5","observation_id":"d8257b31-6366-4abc-b33d-c584e10d86e2","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"TimeSuite: Improving MLLMs for long video understanding via grounded tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:2760a96b2d44c94d17a1dbaa1b1f4268d17bd42f1be9c1116a84de3c37627cbb","observation_id":"f4f3e902-df82-4209-b22c-5d6b2bd34537","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Timelens: Rethinking video temporal grounding with multimodal llms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:48bfcde47c298643b695ad5579796e5d802edc842907d21377cf008365a14bdc","observation_id":"3f3acf0e-1cc0-4948-88b0-115147b5747c","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:92d00b6ddc3d230c0ac2cc3d38a40758c49f984b863d4893aa6b6207833c12d7","observation_id":"c7b498b9-2a23-447d-9ab2-c9eb44e80cb0","resolution":{"observed_at":"2026-06-29T22:34:01.967411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:6e59d6cd24ba00aecb9f8195f8386415354cca967a7b5a8677ab930844c8b0f5","observation_id":"fe8f4150-5d4c-4048-80d7-47c811c70704","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"Subject:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:7b38db0ea087737bf1642593f63d6b1fb660791e9ec7def075b4090574b729fd","observation_id":"396009c7-bbe6-4f50-90ec-c873073f8782","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:ad46e44356fcf925711acd67e2c5917079da331f0ec50875187b15324f1423c8","observation_id":"553b4387-f131-4fa3-a626-0405bd14c439","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:87dd41e056933f1a12a1bd7a4bf5dc50f39c675ba6aa1ca1964a9469a03f95be","observation_id":"0a3d6e56-0b37-4848-88e0-2b8ae83a6e55","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:0eaf7ac46eb060bcbf60236b3851af6508746489ab97c27eba7b592de70529c8","observation_id":"5343485c-65d7-43cf-8324-fe9160be530d","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:37.631870Z","title":"a person opens the refrigerator in the kitchen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:37.631870Z"},"links":{"citing_paper":"/paper/2605.26104"},"observation_digest":"sha256:7261b2b648141ea7a8f9664aae796c88ccbdf441871deba1b44fb49cd786519d","observation_id":"19d6cd0d-e4df-4919-8ba1-f864f3c51868","resolution":{"observed_at":"2026-06-29T22:27:37.631870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26104","last_updated":"2026-05-25T17:58:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T00:35:49.763800Z","submitted_at":"2026-05-25T17:58:11Z","title":"EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":50,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2605.26104."}