{"as_of":"2026-08-09T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f6789124f517bb5749b09a5576e09161aa587cd3c6c084f816ec5c3aeed28ed","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:44:28.083815Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:01:25.879182Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T22:01:26.565617Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.18100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.18100","snapshot_observed_at":"2026-08-05T22:01:26.565617Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","venue":"cs.CV","work_id":"9f270f33-9b89-45cf-a2de-7b2be722ab13","year":2025},"citing_paper":{"arxiv_id":"2508.07683","last_updated":"2026-06-29T02:15:03Z","snapshot_observed_at":"2026-08-06T21:12:13.753696Z","submitted_at":"2025-08-11T06:59:32Z","title":"TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:01:25.879182Z"},"links":{"cited_paper":"/paper/2507.18100","citing_paper":"/paper/2508.07683"},"observation_digest":"sha256:bf2b0e07fff92b578f4566e0e01923217529ba77e98d7bbc8f0e4239135a148e","observation_id":"3f11bd45-d97f-45cc-9b31-38158dba81d2","resolution":{"observed_at":"2026-08-05T22:01:26.572230Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18100/citation-record","integrity":"/paper/2507.18100/integrity","json":"/paper/2507.18100/citation-record.json","paper":"/paper/2507.18100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:30.036353Z","title":"Localizing moments in video with natural language","venue":null,"work_id":"7e6a4b82-74ae-4d95-a1a8-4e643f8b7475","year":2017},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.648673Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:a188ad823ae4a73fcc3926fdc4b83888723b783531251238ca15347f3139ed21","observation_id":"a90309b3-e264-462c-9cde-41863c5bff52","resolution":{"observed_at":"2026-08-06T14:44:30.043465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T14:44:26.658842Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.658842Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:8ae5c807f17d392bcad55f967504ad06463f96694b7d9f74251dab3364c6d787","observation_id":"3bd7d84c-35fb-4ddb-9e32-8624023e4357","resolution":{"observed_at":"2026-08-06T14:44:26.658842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T14:44:26.667166Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.667166Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:e00d4b42ab33a733557ce5e24ca882f25898086f823a8f7b1419e62cdef37724","observation_id":"da08a2d8-c692-46bc-a24a-b359d99bede6","resolution":{"observed_at":"2026-08-06T14:44:26.667166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:30.006338Z","title":"Fast model debias with machine unlearning","venue":null,"work_id":"225d3842-0cf6-4d5f-95e2-5e772d85c93b","year":2023},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.682386Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:7a4fd52266a5ca3f5dcf39ac7ad91813aaddcb7c8d176ed03b785d54a0923be0","observation_id":"148fcb4a-00be-484d-a39d-29b75c0e907d","resolution":{"observed_at":"2026-08-06T14:44:30.012237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10989","last_updated":"2024-05-16T08:11:08Z","snapshot_observed_at":"2026-08-07T05:26:21.502193Z","submitted_at":"2024-05-16T08:11:08Z","title":"Learnable Privacy Neurons Localization in Language Models","version":1},"cited_work":{"arxiv_id":"2405.10989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.10989","snapshot_observed_at":"2026-08-06T14:44:29.412629Z","title":"Learnable Privacy Neurons Localization in Language Models","venue":"cs.LG","work_id":"394f7d3d-fe6d-4076-a1c9-a13e709dadce","year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.702928Z"},"links":{"cited_paper":"/paper/2405.10989","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:064e29344810b98d1a5d5a96e6c18f48cee415b49293f54b806a7fc2d5ad3f60","observation_id":"2aca0a36-c680-4385-a576-0d18e231c8e0","resolution":{"observed_at":"2026-08-06T14:44:29.418897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11843","last_updated":"2025-02-27T10:11:06Z","snapshot_observed_at":"2026-08-08T15:47:53.650190Z","submitted_at":"2024-08-07T17:14:58Z","title":"Identifying and Mitigating Social Bias Knowledge in Language Models","version":2},"cited_work":{"arxiv_id":"2408.11843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11843","snapshot_observed_at":"2026-08-06T14:44:29.371151Z","title":"Identifying and Mitigating Social Bias Knowledge in Language Models","venue":"cs.CL","work_id":"919cc675-5440-4ca0-a520-dd6e4116ea33","year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.711819Z"},"links":{"cited_paper":"/paper/2408.11843","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:2aa1555c46904b1d36b9bbeed298149505ff8f02e2b11890716b7cc9e72920c1","observation_id":"3be719ce-3e73-480f-a0ae-0e7213b8bcaf","resolution":{"observed_at":"2026-08-06T14:44:29.377369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04070","last_updated":"2025-03-13T13:37:57Z","snapshot_observed_at":"2026-08-09T00:40:22.143807Z","submitted_at":"2024-10-05T08:00:55Z","title":"PAD: Personalized Alignment of LLMs at Decoding-Time","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04070","snapshot_observed_at":"2026-08-06T14:44:26.722417Z","title":"Pad: Personalized alignment of llms at decoding-time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.722417Z"},"links":{"cited_paper":"/paper/2410.04070","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:fd958ddcb4f675e991ea48014235d717c77ecec544fef55c72ca064c26ccd50a","observation_id":"84381722-7cc9-4141-988f-97f1899a7d88","resolution":{"observed_at":"2026-08-06T14:44:26.722417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04240","last_updated":"2025-05-25T08:28:30Z","snapshot_observed_at":"2026-08-07T17:25:25.603047Z","submitted_at":"2025-03-06T09:21:54Z","title":"DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models","version":3},"cited_work":{"arxiv_id":"2503.04240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.04240","snapshot_observed_at":"2026-08-06T14:44:29.302352Z","title":"DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models","venue":"cs.CL","work_id":"37cff713-7bd2-4603-8c2c-06e8e612a588","year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.730094Z"},"links":{"cited_paper":"/paper/2503.04240","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:c09ccd2fbba16b3670484a0afd12d0ba00fd9aeae938cb57f1443a99ab682c61","observation_id":"76363f27-e8ef-480b-bd4e-b6012903a9d0","resolution":{"observed_at":"2026-08-06T14:44:29.311823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T14:44:26.743203Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.743203Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:7c331a44638edde426d231ac7e008297d28f0cf7a535c222e4a7dbc8f88bbc77","observation_id":"6a5632fe-effa-4903-8afa-684e809d0e6f","resolution":{"observed_at":"2026-08-06T14:44:26.743203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19317","last_updated":"2025-06-10T07:47:40Z","snapshot_observed_at":"2026-08-03T16:35:28.021243Z","submitted_at":"2024-10-25T06:06:31Z","title":"FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19317","snapshot_observed_at":"2026-08-06T14:44:26.750049Z","title":"Fairmt-bench: Benchmarking fairness for multi-turn dialogue in conversational llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.750049Z"},"links":{"cited_paper":"/paper/2410.19317","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:831331522e49a9879bf855e305515dfa23439f9b6e9017485fbc4cdf100cb508","observation_id":"ae0c8376-9632-42d3-9fb5-412f5f57bee3","resolution":{"observed_at":"2026-08-06T14:44:26.750049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10241","last_updated":"2024-07-20T15:59:46Z","snapshot_observed_at":"2026-07-06T18:46:05.098630Z","submitted_at":"2024-07-14T15:17:02Z","title":"BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10241","snapshot_observed_at":"2026-08-06T14:44:26.764199Z","title":"Biasalert: A plug-and-play tool for social bias detection in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.764199Z"},"links":{"cited_paper":"/paper/2407.10241","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:afeddfd106c884c01681f58d4f230d00fba2dd9b72bbe6950f34409cb3f148cb","observation_id":"3c06c886-8b10-413a-b0cf-01bce557f20a","resolution":{"observed_at":"2026-08-06T14:44:26.764199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T14:44:26.771360Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.771360Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:5c6cfbed8bb5d534be247c8236eaba9fa14c8621bbeb322c1782f4c4dbec4a33","observation_id":"65275dc1-f737-4d4b-8f4b-bbe8f3853023","resolution":{"observed_at":"2026-08-06T14:44:26.771360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10160","last_updated":"2025-04-14T12:14:18Z","snapshot_observed_at":"2026-08-07T16:05:55.084744Z","submitted_at":"2025-04-14T12:14:18Z","title":"MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10160","snapshot_observed_at":"2026-08-06T14:44:26.794508Z","title":"Mt-r1-zero: Advancing llm-based machine translation via r1-zero-like reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.794508Z"},"links":{"cited_paper":"/paper/2504.10160","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:8215739ab1e4d39cc5aafbf3a1ae29d390beb63ae2b3c16c1eec5d58db08a6b1","observation_id":"a8a4ed51-9823-426e-998a-af213afef551","resolution":{"observed_at":"2026-08-06T14:44:26.794508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.978112Z","title":"Temporal sen- tence grounding in streaming videos","venue":null,"work_id":"e97da28b-0f4b-41d7-9304-c846b08680f1","year":2023},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.805444Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:b94e213c8f7e0bd34d182819788a9f16bb90480bd8fca99f6e253a74f20c1700","observation_id":"6ad3123d-5c1b-49ac-933b-58cfde2664d5","resolution":{"observed_at":"2026-08-06T14:44:29.988883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:26.822463Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.822463Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:7666336a9f510bcff4f31a991a823714a758cd937e389c4ed080c1379d45d655","observation_id":"eefa1a95-311c-4e2a-8fb3-21a30bf86986","resolution":{"observed_at":"2026-08-06T14:44:26.822463Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.945907Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"d45453a3-4e1a-4c87-8881-c7ce03320809","year":2022},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.841337Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:759a170cbeb7866517683c9dcbc3e9ffa689bd4f72aa1a95752ef86e1e85afcd","observation_id":"daeabac4-3b10-414c-99aa-9e9c899c4629","resolution":{"observed_at":"2026-08-06T14:44:29.952714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T14:44:26.857040Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.857040Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:d47161e5ad0546849bcaa45414e93d3e6e8bd20932eafc74cbc68bbb3e4f7b6b","observation_id":"2575a69a-4235-47a0-b3a9-027d079ba953","resolution":{"observed_at":"2026-08-06T14:44:26.857040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-07-06T18:17:46.369537Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-08-06T14:44:26.877047Z","title":"VTG-LLM: Integrating timestamp knowledge into video LLMs for enhanced video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.877047Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:e8aea56e31547ee34e70f2befc7c33649ec92c5ae58f9415333eeb54cad3ec8f","observation_id":"4ef51bf0-35fb-4327-8a37-2bc633ce22c2","resolution":{"observed_at":"2026-08-06T14:44:26.877047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.923477Z","title":"Rus- sell","venue":null,"work_id":"7150dbab-7915-4e5b-be47-513becf1fa0d","year":2017},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.896251Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:4b60c7fdd90f01bbac624d536ca8ff7419b9bac5393debb3a3f89634e71ade88","observation_id":"b2622ada-27f3-4294-8f4f-4bab9e8b8181","resolution":{"observed_at":"2026-08-06T14:44:29.933168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.886680Z","title":"Rus- sell","venue":null,"work_id":"cd87bea8-1d9e-4efa-ba07-924953544e4f","year":2017},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.936240Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:8ba028d59cd807851b5ac533f4383c448bfca06a544521a7d1ee52d092bd2c43","observation_id":"7e2e8a22-2f40-454f-b1a7-f0e3f2219e3d","resolution":{"observed_at":"2026-08-06T14:44:29.895060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.858995Z","title":"Rextime: Temporal grounding benchmark for reasoning-intensive videos","venue":null,"work_id":"731703a0-04a3-4a77-bef1-a465e92bd462","year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.960784Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:5754a7a3ba2c882f17f84531afd9a4b13b7d4e00f99d01eae2721178a9e13abf","observation_id":"efb29eae-dfc8-4dd3-85bc-a04cf87e4d04","resolution":{"observed_at":"2026-08-06T14:44:29.865538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.834998Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"41d3bc26-9c24-4113-9542-b69f24388633","year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:26.986994Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:334c5eb7b297a7351cf9c4caefdeb8c4d9426133ae80baf26c4f21f20b4a0938","observation_id":"b9c4a670-72c5-4a0f-ade4-c244a179ef6f","resolution":{"observed_at":"2026-08-06T14:44:29.840730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.796688Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"03469e8a-07fc-411f-9bdc-3aa725d5eb67","year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.016766Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:a592c3aeaa4a64bf212934b8f1b5323fa67aa44b1aad27de85eb23958000cf55","observation_id":"dfaa9457-94d9-46a2-b4b1-dbc93195beb4","resolution":{"observed_at":"2026-08-06T14:44:29.806570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T14:44:27.074124Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.074124Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:41afb7b247897115577059040188f2bf5592c971597aac1f8eaa3730249954e7","observation_id":"9e3f692e-df7d-4f2b-9fa9-27d95914012e","resolution":{"observed_at":"2026-08-06T14:44:27.074124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:27.170352Z","title":"Vision-based abnormal event detection in industrial manufacturing processes: A review","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.170352Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:827004ac5c5db072edb4ed5d80cc146e9947f6933c0d185af7780b82add5ddb1","observation_id":"ff6fa5f9-6258-430f-a590-0594ae6f6a44","resolution":{"observed_at":"2026-08-06T14:44:27.170352Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T14:44:27.386858Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.386858Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:2063eafecc8ec5ad7fd976655a852c57a793b7dad3bcb9c9ae3ced38f0022c7f","observation_id":"ee76819b-041a-4516-acef-d66ac2c934d2","resolution":{"observed_at":"2026-08-06T14:44:27.386858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:27.492781Z","title":"Videomind: A chain-of- lora agent for long video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.492781Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:ce23138af37ad954f65b97b0d8e49cd6305412673431565e5ca10a442ef47ff3","observation_id":"2922b5aa-a159-4c90-9d4c-df27fd5d8a42","resolution":{"observed_at":"2026-08-06T14:44:27.492781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T14:44:27.622612Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.622612Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:9baeb9139e4526d9488c7d696384729fc6e1e37715b06ada4d31ba1de6be7e70","observation_id":"472e7546-6d6e-4825-bea1-1c087b4cddc9","resolution":{"observed_at":"2026-08-06T14:44:27.622612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.772967Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":"445c02e0-b4bd-4a91-a6a6-da95ca9a317c","year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.773190Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:bdc2991512aff954b07dc7d00bc22a3377feb99c35e7e256172c074edc00834b","observation_id":"bae4e109-7ec1-44ba-bb17-9a67a895d85d","resolution":{"observed_at":"2026-08-06T14:44:29.781046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.741131Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":"e8c2bcc6-5259-47ea-acb0-3c5f7b01fb53","year":2021},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.927600Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:4dc9869cd73942226e6dcd2549d4a45449bf24ec35c6476a38142fd42e7d22b0","observation_id":"6dd05566-7f72-46d3-9fd3-6532bf57abe1","resolution":{"observed_at":"2026-08-06T14:44:29.757043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.718743Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"1bbd7b0c-9c3e-4600-a1da-131b4ace7733","year":2022},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.949921Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:06c8f092e74b21cc937ffd60c92b1f7f095dec1c3936e3ddf964e3b8d1aa6632","observation_id":"42a335cb-5509-4a9f-9df9-b6756a7ba707","resolution":{"observed_at":"2026-08-06T14:44:29.727645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.683457Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"063f9e9f-eaad-4c54-b441-9bca13a87494","year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.956992Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:625338248ed0ad67be216229fa26731d03c769d99be0a9e55b3d37bb4258df68","observation_id":"a2754122-ec39-4095-acd2-ee992cf205ec","resolution":{"observed_at":"2026-08-06T14:44:29.693256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.661299Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"96545c14-c963-4d6b-ba75-215411b6ad74","year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.962343Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:76975a6dc510aadfb69eccf2fcc7529b7ce49c7d96884a94e9fe9a574141f868","observation_id":"9effb798-71c0-4ee0-8958-0e039d2cffd0","resolution":{"observed_at":"2026-08-06T14:44:29.668576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T14:44:27.970157Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.970157Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:2d7a9b9f0b3e78f87c8594442d1d7fe37fbd00c695bdb30eb53874f5ae73c5d7","observation_id":"c29b70e7-09f3-4b13-9a59-427efecd68d8","resolution":{"observed_at":"2026-08-06T14:44:27.970157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T14:44:27.976176Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.976176Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:31df28b287005a3a90b83510a35bb6e2143326a6a4d755a2eafd276ac16a1b08","observation_id":"a6d2cb88-9574-461b-b008-88b118aaabae","resolution":{"observed_at":"2026-08-06T14:44:27.976176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.635290Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"3bb9eaaf-f3ce-4c18-b5b8-578fd9296f29","year":2020},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.991887Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:39d85df8284097751cb0d2053f69caf5540caed4aab7a53a12b9ae4406c6322d","observation_id":"d1a79803-5d28-4527-a7c3-8f5b0c6ccf69","resolution":{"observed_at":"2026-08-06T14:44:29.642526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:27.998631Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:27.998631Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:f3276882ec853391c644e743d001dd7fe845eadea3da50e459b7a3fc88c872fe","observation_id":"b5290e83-3aaa-4961-ac50-c2a0c652807a","resolution":{"observed_at":"2026-08-06T14:44:27.998631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:28.009266Z","title":"Endonet: A deep architecture for recognition tasks on laparoscopic videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.009266Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:14fefab1bbb78cdd0662c9520564da1f33bf75a6d6252bf3eb9ea169d64c80c0","observation_id":"81b51efb-d814-4f25-9b49-ef5fa4e68074","resolution":{"observed_at":"2026-08-06T14:44:28.009266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T14:44:28.022951Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.022951Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:d008413ee490a9b1d0d10df264017aa18163a501d2bcaa775dfd8a6410788894","observation_id":"e660d4f9-82e0-4d07-941d-532b62ab2a88","resolution":{"observed_at":"2026-08-06T14:44:28.022951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T14:44:28.039862Z","title":"Time-r1: Post-training large vision language model for temporal video grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.039862Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:b0e7652e2c966c74499363f6e64eadbe4881e5953040df0714b8f6e3c443a0af","observation_id":"67e962c9-f402-42cc-accd-73d4f0f5d21b","resolution":{"observed_at":"2026-08-06T14:44:28.039862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T14:44:28.044936Z","title":"Internvid: A large-scale video-text dataset for multimodal understand- ing and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.044936Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:edc6825f33518aab036411970615b66b1e30ca37aebd040c6f6b8342979d2f09","observation_id":"59763ee7-6e67-4e6d-b335-f5a1fe341371","resolution":{"observed_at":"2026-08-06T14:44:28.044936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.594313Z","title":"Negative sample matters: A renaissance of metric learning for temporal grounding","venue":null,"work_id":"320e4ea3-b995-4d01-9f49-cdf6849a67a9","year":2022},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.054818Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:ce5a8d8f05fca71078f0f13d4de320c18e0c44f4d2183ca4929a6edfe6993e10","observation_id":"0ac855aa-bf5d-4241-b934-ad217b4760e0","resolution":{"observed_at":"2026-08-06T14:44:29.601397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.554249Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment","venue":null,"work_id":"cc194459-85da-4a8f-a8fa-8c46e8779ecc","year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.060051Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:bd02258e0ab4e3dc59735bca59f69f7445cb626006197be5441ff624c17cc526","observation_id":"2624e562-586c-4510-9021-4a9a718ab2a2","resolution":{"observed_at":"2026-08-06T14:44:29.560717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T14:44:28.067796Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.067796Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:55d9396374dde365e40811196d0395289ba326cc6e19391a0ff9c4b443e9c22e","observation_id":"73eb49b6-1c4c-4ef8-9b1b-76db014ee429","resolution":{"observed_at":"2026-08-06T14:44:28.067796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.523969Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"5aa1c869-7eb7-4746-90f5-584fcccf8d5f","year":2023},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.075649Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:bd099f292e82c5bf778932944620dbaf21caa1a071693b1dad170cf45c8c3bea","observation_id":"fda3be5d-d14e-4c9f-beee-1afb22b586bc","resolution":{"observed_at":"2026-08-06T14:44:29.533067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:44:29.494325Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":"5ceabfe4-7346-4d1a-97ab-c2ed6b220af8","year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.083815Z"},"links":{"citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:3d0bf2f290461d9d33ff4cb7a94d98736fe7fe421beaae666a91b4e41ed1f6f1","observation_id":"a994773e-d3cc-4a18-8195-f8a332cf21d6","resolution":{"observed_at":"2026-08-06T14:44:29.504803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":19},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2507.18100."}