{"as_of":"2026-08-08T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:959d8ebc3399337c284ae4bf662eecf4665c82575e69fbe91aaa1448e5e2f121","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:12:19.056273Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00775/citation-record","integrity":"/paper/2606.00775/integrity","json":"/paper/2606.00775/citation-record.json","paper":"/paper/2606.00775"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Tall: Temporal activity localization via language query,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:42e4e140e1a99b1113edb94998bf3faaf59ed39ebe90a37ab4ca0deff247d618","observation_id":"f465561a-3f0c-4de7-8780-014ae0fba43b","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Localizing moments in video with natural language,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:926ebdc0c4c0e4a0993b0440663d60494982f0caafb5789400c5e57c3cd5dd90","observation_id":"adb7708f-0c59-4c01-b3bd-7dc6993229dd","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Maban: Multi-agent boundary-aware network for natural language moment retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:81ce9559c4913047986a01a1bed160db5fb57bd3ae4f655ce69b64968afa1d89","observation_id":"9207add4-b91d-48ae-8b76-e1f820ac0dad","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Temporal sentence grounding in videos: A survey and future directions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:781140e7e9d766733ad5e4e08708b6a471592e54a1f3f070f6dbde442f8aea1d","observation_id":"d03f14fb-7f39-4c90-8d18-7a267646acae","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Video moment localization via deep cross-modal hashing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:087d8ddbb1741d32edb1b4277b4cfe1bd8e0fe1a4d1c85065f454fb918a89b78","observation_id":"0f8d28db-12da-4d4f-8f83-944fe0b78edf","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Local correspondence network for weakly supervised temporal sentence grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:633e98a1ea4e1cc44ec6e7368d7347a881f6129b5dfd05cddcc2aabd60ada3f4","observation_id":"9cda1038-f5b3-4e48-8fd3-e208c6d054fd","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Video moment retrieval with cross-modal neural architecture search,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:7fa212d1bb00caa8adca1fc83fdf9c45e764c6d37f67b2442fcfa5b8a2e26f32","observation_id":"a11d3f02-1768-48b4-a96d-ed9d0da12550","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Bam-detr: Boundary-aligned moment detection transformer for temporal sentence grounding in videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:019aae19995f1cd417f17baa083075d8b25d28ca7cfc8788bcf8f8a1ef2f4ce4","observation_id":"00692f0b-e274-4952-8d02-a7704d90d5c3","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Bmrn: Boundary matching and refine- ment network for temporal moment localization with natural language,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:e70e77f9da852ecb4adfb3fd1a66d0659ed8c4a467b422a1ab8d18911befbe7a","observation_id":"453223da-0558-475d-8cc5-02b6c79a35f2","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Time-r1: Post-training large vision language model for temporal video grounding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b393361065b6eaf50bfc8be826e6ee57c44002343701609eb05f3c5c2645ab71","observation_id":"8ebdf27c-d33d-49fe-8895-41903945d3de","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Datasets and recipes for video temporal grounding via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:bf00cf604ce37716516e0545b2012b06b8e2db3223997cc063271ed93bf77d28","observation_id":"006f70b7-f2b0-4dfe-9705-b4dd760c21ea","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Detecting moments and highlights in videos via natural language queries,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:6279888ac5b78fef0833ef2491b3619701605cea40bfaaad3b6b59459548eae4","observation_id":"5cc408cd-e345-4725-be20-c3eb4a9a25f8","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Correlation-guided calibration of query dependency for video temporal grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:2afc12c71340722502f0f710b31128b542049ae2b1a8eb87598124b8f86ad0a4","observation_id":"c58c0a7c-2a63-4808-bed8-4e58cb883788","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Tr-detr: Task-reciprocal transformer for joint moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:1a2cd949d34a7de6f728159bc40cfd2ffc7da7c296e1eabea3242beeea74300a","observation_id":"dc839488-eeef-468f-866a-d88c6eedbbfe","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:530f254c43b2f25dd8c6f79fd0b088c40be111c291ca81ced88094a956b51c7a","observation_id":"bb899f93-7858-4d67-aed8-2e3c979edce7","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Bridging the gap: A unified video comprehension framework for moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:aae0e4c555319fd1184d9549cc44efb984d5961facc9e0df01fc38ef1cfb06d4","observation_id":"a37b33f3-5e5d-47e5-98f8-15f089170285","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b276432a170dd464e4b02f6d2ebc74b3e2b589c52c28e8cc3c582a2c054eca83","observation_id":"1a426ad7-40c9-47e3-ae1a-3e13049c8f07","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Aligning large multimodal models with factually augmented rlhf,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:1134c3dfa12f7ac5775a36f47cdcc27ba8825128d4291f64982409bf6a797543","observation_id":"201b44d4-b361-4e0c-af74-4c814f355fea","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Video-r1: Reinforcing video reasoning in mllms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:9ed7175ab536606f8c692c35bdc60e9549041a80b1642031a7b1f5c27f1b0645","observation_id":"a8c9ef08-fb25-44d9-9c37-3bf43ded6860","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:daaf93ab693f1a94f2330dd9a7a3f79e0ad0cdcb82ac428538a05a83ae1788d2","observation_id":"0184536a-2922-4441-9350-5757af83f581","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Policy gradient methods for reinforcement learning with function approximation,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:cf4cab08b0a9dd06c444866698341d131cd4773a910ef488a943b0df439f920f","observation_id":"3db00ca2-cdcf-4dee-9630-d3a37986e2ad","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Overcoming catastrophic forgetting in neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:44502c1aa826e6b42fdb2f21749a1e8690ed4c94b942f4ee4957baa6047a89b8","observation_id":"c9d9d3c1-7dde-4766-a391-275d8254cec4","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning without forgetting,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:74038411b13ad2994ba4f4f510221c1e1d0eb2844018e2a6fdeaa5bc8e4fc395","observation_id":"7fc4dafe-d46f-4630-bb1e-484bc4445d80","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Context-aware biaffine localizing network for temporal sentence grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:f8dab5cff489ee14c7e0265f0d36a8a652123c6177094c28ba4484567b5fa4e0","observation_id":"9e5d3736-bc3b-43eb-8a49-2f1e26f0e726","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Grounding action descriptions in videos,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:0cc93060f9651ef40616e37a3c8a0821745c5b3f33d008bcb93773fd5867d37f","observation_id":"3684139f-948d-41d6-9697-5143d222b4ba","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"To find where you talk: Temporal sentence localization in video with attention based location regression,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:ac4f93b16710526b556d915ea7079b3595c525fa803f6add521f036e67bf45ad","observation_id":"6682f9d4-1ed7-4bad-9a59-878e5584cc97","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:6e244e9d962352353d3a985a0c1808db9f1c845ba23cf893ab19a70bd1e65df3","observation_id":"b61d8a34-f5ac-40cd-b44d-afb9f2db4362","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Span-based localizing network for natural language video localization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:fc2cbb16eceaf77b59664a7d86728b42e56ee3928eb743661a3667f7709be97b","observation_id":"ec916a8b-ffee-4b1c-956b-f5ad3f572b89","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Dense regression network for video grounding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:fe596a32b21e9c054c146861ab4ac749bd2c07d2ac3fc1a897ed40bbf8a2e7c6","observation_id":"86a52aee-ad75-455d-a681-013538e03313","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning modality interaction for temporal sentence localization and event captioning in videos,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:cad5703a59c259c10e8b5309c01e390ae21b069aa12171a5d4518834b430bf75","observation_id":"ba45f08c-cf44-4eea-bc31-85ffb724b179","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Multi-modal interaction graph convolutional network for temporal language localization in videos,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b20b1a550636f2d2d28481478ba4eb7cb6856a595b932d40db72adcbe3e5ba96","observation_id":"fb659fde-1eda-4f95-b56f-cb7c7106a045","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"On pursuit of designing multi-modal transformer for video grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:239b90cf8c30d6d8f9aedb3445751a0db43116129335fc054a538e5abe739555","observation_id":"0eeca70a-c714-4b6c-9483-6069e8467ad7","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Query-dependent video representation for moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:f219ffccbb888cbf350caadb58f6618a45d116806734b6ef03ede6c1da2f82dc","observation_id":"fd14af81-937a-44f1-b8b0-166f25daa0b0","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Knowing where to focus: Event-aware transformer for video grounding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:05e7e5fa45d652ef41b77dc952dce6777293488fff5699dc0e5eaf6f2d24bc64","observation_id":"24c0deb2-a9fd-4422-bc92-88c807a1da80","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:634566586cbd89145a68026732db664ded28e164334eca0eda3e8b4de8891964","observation_id":"2513675f-6a24-49a8-aeca-62d4b3bb630e","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning to summarize with human feedback,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:3e9cf03c433d875e547343dfead4c720b98602323432a5386f5a510d2b00df24","observation_id":"7ef15008-48f1-42c8-97eb-303901602b8d","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:0291e4dad1d9b80b2c14d97bee322c1c2d62af0fab1ccc9e8001e1558a15a9f9","observation_id":"2801eba7-0c26-49e2-8957-72a1a26ce822","resolution":{"observed_at":"2026-06-28T19:12:34.383083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:785e6489b630ff315240018a446e0e4190648266b2f94a41228f422d67022cc5","observation_id":"d39c71fe-148d-4576-81aa-6a2fb36aec8f","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b93fb29d32f2e67ea4440b327ff8b08c187ad922f8c2270a87763a828621c72f","observation_id":"7c1c6eef-3d01-468e-8481-9f226925db52","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:7811ef88dd621234b385c70c3d622b04732ef65ca7977ba0893196c967da97fb","observation_id":"0c73b767-4bf4-4697-a6ca-f382dceef4c6","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:8c58c12af8c0b9e46d5b9065d5d5c64497bc93f73de86a99043d1f107e9df780","observation_id":"d60dd2ad-e7ff-4ebe-afb1-50cd8d4fc5ec","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Active object localization with deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:7f26bdf867d5e8549a0255336fdf458cfa8bab7fb3fbe7f336a342362c7549b4","observation_id":"d83a4d7a-4d5a-489c-9221-9eab4127507f","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Read, watch, and move: Reinforcement learning for temporally grounding natural language descriptions in videos,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:e195397137c785622395da217934cf8483a330e9da7aa99fa8e948908250b428","observation_id":"c3e5670a-7f83-4477-bc87-fdb1c648aa28","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Tree-structured policy based pro- gressive reinforcement learning for temporally language grounding in video,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:e741c0f56bc9b9c1430c2b29d417fbb2bc91ca0b9de7c1486374f83cdaa4258f","observation_id":"449bec6f-39d1-479f-90d7-dcc00382c64a","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:ef7488b8ef284ba7efb0ca627c0d0e4041b669f9e5978510f9882abd19ebf0ba","observation_id":"137feabc-ba8d-4ec2-a3c9-050b292f38ca","resolution":{"observed_at":"2026-06-28T19:12:34.385538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Spatiotem- poral contrastive modeling for video moment retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b0a1a643f6186b91ed1d6fa061b89258aaeffa15ff440180efaa92988f88e0f2","observation_id":"73024ba5-a11e-401d-984c-72ee9a38c0ce","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Momentdiff: Generative video moment retrieval from random to real,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:f9fa30d263ebf239e8cdf40b235ee6d7061657aca4f8a0d4a64a485024dc9ee5","observation_id":"ad8848c8-8f28-4570-8028-ad369c1cb4ea","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Univtg: Towards unified video-language temporal grounding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:d172a630b52709d1acbc0057c18a3e2fead530062bae05240cf984a3d00f9eb0","observation_id":"f8e0d7d0-0acc-4014-bb28-0e46658e8eeb","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Prior knowledge integration via llm encoding and pseudo event regulation for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:ed3d64d24f3647cc968fcf2f2cd4340b0c90434cc983e0cbc5c932ee2cf823bb","observation_id":"60a38052-4342-4885-82c1-7ae9e16d2d7d","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Diversifying query: Region-guided transformer for temporal sentence grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:ccf4c031b4c42b9da26c5c0d6559edf9bc5a4ebb082307eb7ed08a44493bc463","observation_id":"b77e124e-8c3e-47e7-8f7c-ed0116cb1009","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Maskable retentive network for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:f72644d2495d4d0fe2a2ffa86d7c72f2637a6c1472c0ebec55fa00d35e4ff491","observation_id":"458bbce4-6293-4644-ac60-5f64d1ec4807","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Sa-detr: Span aware detection transformer for moment retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:ec481c5c09a04bf460095da10534a76355b3f43193cdec8b9bb32f3dafdb70ce","observation_id":"1b606574-bba6-40b9-8741-c5f99637a894","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Query-aware video encoder for video moment retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:fe32ad4eb4a53707ce1bed10c06fed693553d5878ef79ad3992c011a6ca20cff","observation_id":"6711d2ec-ffc9-4188-ad23-000e5fd93088","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:920e736df6b742aed637283c89676083af3cd6a66ca8725f57680a6a4ac596b9","observation_id":"e076bb6d-c027-4484-b204-8eabf96d5909","resolution":{"observed_at":"2026-06-28T19:12:34.378295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:4119cafdca24e12500da2f35c802ddc32269135c0f24d979ea66e35f51ac2254","observation_id":"e03efa0a-cf11-4f15-b940-6938ba129be0","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:53d27db3b4b5e18878364381057116aaad57a68d11b8d7f67df1ec2de48394ea","observation_id":"8d9d6d38-27b7-420a-84ea-c7b2da6d5d18","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-01T19:17:08.239976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":"2403.15377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-07-04T06:39:37.518508Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding","venue":null,"work_id":"1f0f626c-f5dc-428e-9eb7-3e99516c1cc5","year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:6504d47e174e0d3bbc9d4535a56daf19509278869c66ea7935d43e26e323c693","observation_id":"825cb563-f5c1-4de2-8225-143668a3cd13","resolution":{"observed_at":"2026-06-28T19:12:34.375723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:e54e8bd6abd24187e343ba7b516dd29cc0689cfed9ea7b2f9dc47af60ce2e8bc","observation_id":"bb0cac3c-f812-47f2-8461-ed2a6f99ab48","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.01558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:34.379353Z","title":"Video- lights: Feature refinement and cross-task alignment transformer for joint video highlight detection and moment retrieval,","venue":null,"work_id":"1d7f0c3c-9e5a-4d5f-81e9-e364f247aa76","year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:30f27ec7893f93997e83f0b027578b663ca40e729f7241f9d4201ea0e8e8a225","observation_id":"1650114f-a48e-4d78-8233-857bcf70c9e6","resolution":{"observed_at":"2026-06-28T19:12:34.380827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2606.00775."}