{"as_of":"2026-08-08T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5e57512d37b2d2c7f372e37b293180fcccd09fc3892121d1418ab3f9d38a2f7","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:59.938701Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:28:56.047745Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T05:56:07.964144Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15447","snapshot_observed_at":"2026-08-06T10:28:56.047745Z","title":"Viarl: Adaptive temporal grounding via visual iterated amplification reinforcement learning.arXiv preprint arXiv:2505.15447, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23779","last_updated":"2025-07-31T17:59:09Z","snapshot_observed_at":"2026-08-07T19:37:53.724256Z","submitted_at":"2025-07-31T17:59:09Z","title":"Phi-Ground Tech Report: Advancing Perception in GUI Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:28:56.047745Z"},"links":{"cited_paper":"/paper/2505.15447","citing_paper":"/paper/2507.23779"},"observation_digest":"sha256:92c4934f06ce6da264fa3b86c49c53e88a25f378c0a2391414d304f1fa3db1da","observation_id":"8527e4c0-d110-4e6d-818e-d6e4fa602931","resolution":{"observed_at":"2026-08-06T10:28:56.047745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.15447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15447","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Viarl: Adaptive temporal grounding via visual iterated amplification reinforcement learning","venue":null,"work_id":"0c23a691-242b-45cb-9414-f1c23f47fc66","year":2025},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-01T16:56:58.243776Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2505.15447","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:7d104c1b79ef02f36807d564d2847361fe33434d464623f152a73a3204580362","observation_id":"125702e3-0b83-442c-b5ec-d8ac8b39a4d9","resolution":{"observed_at":"2026-05-22T05:56:07.967892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15447","snapshot_observed_at":"2026-08-01T22:38:43.510039Z","title":"arXiv preprint arXiv:2505.15447 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.510039Z"},"links":{"cited_paper":"/paper/2505.15447","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:16f899624e261e2cdebee7fc20e718069f71fb3b5bf158177ba9a6521a22fad9","observation_id":"3638ec97-6a7f-47c4-81fd-d04f151aeebf","resolution":{"observed_at":"2026-08-01T22:38:43.510039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15447/citation-record","integrity":"/paper/2505.15447/integrity","json":"/paper/2505.15447/citation-record.json","paper":"/paper/2505.15447"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T15:20:56.425325Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.425325Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:56f3ad49c9d520ba8936079ad3783ac7dbf7f07e8e5ec5bcd63ceef7fd6cc671","observation_id":"cf12f22b-1d92-4016-afcf-f6ebf19bc729","resolution":{"observed_at":"2026-08-07T15:20:56.425325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:20:56.475604Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.475604Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:137adc2af8b88ed5b598c97b2565e042596dd40cc00f55492760b93f482ef9a3","observation_id":"27ac58e4-903c-438f-8d0d-c130fca152aa","resolution":{"observed_at":"2026-08-07T15:20:56.475604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:56.552758Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37:19472– 19495, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.552758Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:3ece1c88c9fe329024cf1bd713332fa3464cfe967f05b28b24dd8382f79cc813","observation_id":"342666bf-c2fd-4629-ad13-108355f1159c","resolution":{"observed_at":"2026-08-07T15:20:56.552758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:56.612041Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.612041Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:5a56cf7679caa33da042d8cd83738ca775b5727c80874c367a80f79136702c85","observation_id":"6bd6c3fb-fa54-444c-8940-686612390029","resolution":{"observed_at":"2026-08-07T15:20:56.612041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08575","last_updated":"2018-10-19T16:30:48Z","snapshot_observed_at":"2026-08-04T21:33:05.702276Z","submitted_at":"2018-10-19T16:30:48Z","title":"Supervising strong learners by amplifying weak experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08575","snapshot_observed_at":"2026-08-07T15:20:56.700519Z","title":"Supervising strong learners by amplifying weak experts.arXiv preprint arXiv:1810.08575, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.700519Z"},"links":{"cited_paper":"/paper/1810.08575","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:e1436e86b97d515c3069c0f75bead4ab7244386f691948ca3c870594834e7e0f","observation_id":"7df3f253-5ae7-484a-8a85-caa50585f1e0","resolution":{"observed_at":"2026-08-07T15:20:56.700519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-07T15:20:56.775593Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos.arXiv preprint arXiv:2408.14023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.775593Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:ff4760772cf43b339eb787d3b5705c55cfc5c1f70b09943e32db34b3d1e01613","observation_id":"4c265e10-9dcf-4610-9ba4-825985f4bb4d","resolution":{"observed_at":"2026-08-07T15:20:56.775593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T15:20:56.873824Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.873824Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:d104e9530bd264e54cb87838dbd5de22faec77fcd78d173eb13fc99b3c01a7b8","observation_id":"71f78dde-a786-407f-a9c0-4cac870c7a37","resolution":{"observed_at":"2026-08-07T15:20:56.873824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T15:20:56.957053Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:56.957053Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:b18eeb91285ec164be7633cbd01f0a26e8cc6642fe0f6eee230906159f6c9787","observation_id":"dd2ede75-5c5b-4b78-bb51-b4595d376349","resolution":{"observed_at":"2026-08-07T15:20:56.957053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T15:20:57.028711Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.028711Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:03fce586a6c19cf4db4bcbdf265b025229b1fda93f09aaceb7430f8b0d96c6ce","observation_id":"f85709bc-2a0e-4bd8-bbe6-daaf4d5c108b","resolution":{"observed_at":"2026-08-07T15:20:57.028711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-07T15:20:57.091933Z","title":"Cos: Chain-of-shot prompting for long video understanding.arXiv preprint arXiv:2502.06428, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.091933Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:d9507253f26bed6b5b9672e51c3a350bbd3f537a9b7dd06e94ec56ddb77fd006","observation_id":"db2ab293-089b-4639-b534-f9246a05f5a8","resolution":{"observed_at":"2026-08-07T15:20:57.091933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19680","last_updated":"2025-03-26T21:14:41Z","snapshot_observed_at":"2026-08-07T17:44:28.017052Z","submitted_at":"2025-02-27T01:44:13Z","title":"M-LLM Based Video Frame Selection for Efficient Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19680","snapshot_observed_at":"2026-08-07T15:20:57.174134Z","title":"M-llm based video frame selection for efficient video understanding.arXiv preprint arXiv:2502.19680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.174134Z"},"links":{"cited_paper":"/paper/2502.19680","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:e6e4a5cb4db98f8f9ab642257782e4426495d511871e778144558057cd98234a","observation_id":"0e53acd5-2aaa-4d8f-9a02-327391ec0747","resolution":{"observed_at":"2026-08-07T15:20:57.174134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:20:57.242364Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.242364Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:df058697e6297eed33c202c16618b250017e141f14dea955ddd43c3848bc29ae","observation_id":"113e3bc5-eadf-4c37-92bb-29c545e23c57","resolution":{"observed_at":"2026-08-07T15:20:57.242364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:57.315079Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.315079Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:b2edff57f64cc9aab4562abe86bb6c8a5e993a3b7093d25a4d5709f3e8e759a7","observation_id":"0cf1332b-7be7-4177-b5e0-de0665d5f8ad","resolution":{"observed_at":"2026-08-07T15:20:57.315079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-07T15:20:57.409103Z","title":"Remax: A simple, effective, and efficient reinforcement learning method for aligning large language models.arXiv preprint arXiv:2310.10505, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.409103Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:ec5a1726d5239803f499bd685b67f6847847da1c3d2a12cc41a1b4fa8a2ea0f0","observation_id":"2e2e35f4-2831-4741-985a-97dad4e1fcc7","resolution":{"observed_at":"2026-08-07T15:20:57.409103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-08-07T15:20:57.485440Z","title":"Keyvideollm: Towards large-scale video keyframe selection.arXiv preprint arXiv:2407.03104, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.485440Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:3b88581acd417c88591baadd2668e67bf70ff928aef974de4769a71512ace69e","observation_id":"da9d7c4a-a09d-46f1-aee2-ea29148cb717","resolution":{"observed_at":"2026-08-07T15:20:57.485440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T15:20:57.562364Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.562364Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:0b6da663dbd096cee5d4633de98ba6f9ed31496eab199917b0c1171311ea2b98","observation_id":"720ecb11-afd2-4c2e-a1bb-ad1569845d9f","resolution":{"observed_at":"2026-08-07T15:20:57.562364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:57.634142Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.634142Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:5aecad4257523fe829e3a9fa993517cba3ffc3f8589bd813e691378c889f6797","observation_id":"399c84bd-a020-40a0-a430-6bdb27af0921","resolution":{"observed_at":"2026-08-07T15:20:57.634142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-07T15:20:57.694251Z","title":"Kangaroo: A powerful video-language model supporting long-context video input.arXiv preprint arXiv:2408.15542, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.694251Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:84756d38f7115f1fa94ea7a8ec1e949ba4669388293f4112bb1bd64ffdf02616","observation_id":"8335557e-cb75-467b-b018-6d8712a4a5b0","resolution":{"observed_at":"2026-08-07T15:20:57.694251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:57.763628Z","title":"Hello gpt-4o.https://openai.com/index/hello-gpt-4o/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.763628Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:368c41c856fe5438fd68cd70cfeae14815d35d0a81a22d87d63e6845388485d5","observation_id":"3a699b2b-43ba-4426-a63a-3c27efa0be05","resolution":{"observed_at":"2026-08-07T15:20:57.763628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:00.639552Z","title":"Ai 2027.https://ai-2027.com/, 2025","venue":null,"work_id":"72d10ddb-d34a-4a7e-8bfc-931984e57d78","year":2027},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.848572Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:d561178d684625687373cf7bc5e900ca2587f4fb5edf5f6967290229f4f41297","observation_id":"c66a802e-73d2-4f05-8583-4eb95c48834c","resolution":{"observed_at":"2026-08-07T15:21:00.704398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:57.917067Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.917067Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:48c99ccd6ce33ae4fda51fbdc5b1cd33f5da3ab19aa471784fd6654c57663273","observation_id":"74c24c73-18f8-4c77-a611-7f3807c6e079","resolution":{"observed_at":"2026-08-07T15:20:57.917067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:58.009144Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.009144Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:d9ddac10621069166e315002052703b83d8a65980533409d319615e0b30f02cf","observation_id":"fbfa3356-28f4-4ebe-b8a7-afdc691d7104","resolution":{"observed_at":"2026-08-07T15:20:58.009144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:58.095416Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.095416Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:93cc029ff80f0185a995cbe3d7979e5abee2262944d40476e2b07f5e90b1193a","observation_id":"436ddb25-59ae-4f29-aed5-494b4d635f43","resolution":{"observed_at":"2026-08-07T15:20:58.095416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:58.248304Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.248304Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:12d67fa1bc802878da8199942c5977f492c32f5988d17c64f4acf19348cae835","observation_id":"d1e8c877-96e5-4be1-834f-8bdbff7da2c3","resolution":{"observed_at":"2026-08-07T15:20:58.248304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:20:58.362338Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.362338Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:17957f8bfdb34c8c1eba55b7ab0de8d8276a1babd10c149068acbc197c4d9936","observation_id":"9115f05f-a2f0-4b8b-9f4e-6fe819ccecad","resolution":{"observed_at":"2026-08-07T15:20:58.362338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:20:58.456192Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.456192Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:c0245ea9c1cf03dc9e46c3e32cb0c5554c923b45d66ec426a853d1a963c00b55","observation_id":"87adb3c3-3276-4d74-b086-2120528e9b70","resolution":{"observed_at":"2026-08-07T15:20:58.456192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T15:20:58.584507Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.584507Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:bd31dc22658ad2679d56bc3c50f48702459513db26b6f16c75089507ca62c6ed","observation_id":"8d9c289e-2d5a-4082-a8ec-fcc72a4a1192","resolution":{"observed_at":"2026-08-07T15:20:58.584507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:58.676634Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.676634Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:644151cac4474bc5d5dbacfec7f7e89f0a83b41dbe182d8d0f6bb241a4ac5ebe","observation_id":"dbe22634-eae3-4339-8748-7cdf90877cd4","resolution":{"observed_at":"2026-08-07T15:20:58.676634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-08-07T15:20:58.751103Z","title":"Adaptive keyframe sampling for long video understanding.arXiv preprint arXiv:2502.21271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.751103Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:220bff64120a43e5a397938e2819eccb97b36e4ea8380b71e22d900b4a588e1a","observation_id":"a5fc3f40-2601-4cb8-a4ee-395a76b206cf","resolution":{"observed_at":"2026-08-07T15:20:58.751103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T15:20:58.826451Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.826451Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:427eeac3eabf571e982f0bb7cbc3bd0ba63991592708c0475818b9d00425bf9a","observation_id":"65c61772-c52c-4bbc-9c30-2dd5b0872121","resolution":{"observed_at":"2026-08-07T15:20:58.826451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T15:20:58.975786Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.975786Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:00d6d35f1016035158365b4fea7fe63ca48eecc62463c2c7bd83c657f4d6e21c","observation_id":"be03e616-7c36-4067-ba95-416a5bc8a359","resolution":{"observed_at":"2026-08-07T15:20:58.975786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T15:20:59.072257Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.072257Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:9c211b84860eed0aaa777f0f88fe7ff1faa80b6acaf246a5c9810684c441dc6f","observation_id":"8ffb3ee0-50c0-4ea5-affe-48f2ee8e725d","resolution":{"observed_at":"2026-08-07T15:20:59.072257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-07-06T20:18:35.429115Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05037","snapshot_observed_at":"2026-08-07T15:20:59.162625Z","title":"Longvitu: Instruction tuning for long-form video understanding.arXiv preprint arXiv:2501.05037, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.162625Z"},"links":{"cited_paper":"/paper/2501.05037","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:b7a8d3398ef2cdf2ccb6ede13f5822466ddd88689e2109179d0258e203695d79","observation_id":"1445af28-cabc-47dc-8c25-d4d3be3d296f","resolution":{"observed_at":"2026-08-07T15:20:59.162625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-07-06T19:51:01.075884Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-08-07T15:20:59.262348Z","title":"Number it: Temporal grounding videos like flipping manga.arXiv preprint arXiv:2411.10332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.262348Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:5bfa7ecd734a11affbc1778f854a0182269f87119321e01acded3f285cd8e691","observation_id":"4e3c51c5-4ff5-45b9-bf7d-a5636c50b639","resolution":{"observed_at":"2026-08-07T15:20:59.262348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-07T15:20:59.359347Z","title":"Frame-voyager: Learning to query frames for video large language models.arXiv preprint arXiv:2410.03226, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.359347Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:6104e98d7fd8d502c44c74eaef5de7e5836eb550efc94b2442e14e4b489ca67f","observation_id":"7a6ad6ee-18f4-468e-92b1-152590b8d05f","resolution":{"observed_at":"2026-08-07T15:20:59.359347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T15:20:59.427397Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.427397Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:1f9b1e117537a29f9902779e9116c2972af14c9fd31e805ea8b1a3390866e3bf","observation_id":"8961aedc-0025-46cf-a0aa-5d0cca75b54d","resolution":{"observed_at":"2026-08-07T15:20:59.427397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T15:20:59.552615Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.552615Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:f46040c50e779e43a16e1286bee96322ae478a7c5f62e36f22bee754af5bbd01","observation_id":"686d382c-f69d-4325-9780-7c48d5248f4d","resolution":{"observed_at":"2026-08-07T15:20:59.552615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T15:20:59.633738Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.633738Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:c2d48d0018fd2920ee373227137ffc2c41361551d5eab6b33aff69a9698ed2a9","observation_id":"75ba5317-b5ea-4f21-b12a-517e7916add4","resolution":{"observed_at":"2026-08-07T15:20:59.633738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T15:20:59.712696Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.712696Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:902ee2d851a7145612a46358a5dd62c7fc2825efc6b5c306a4331b0dcd919eae","observation_id":"2855bbcd-de4e-45a1-b7e1-4e80a065abd8","resolution":{"observed_at":"2026-08-07T15:20:59.712696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:00.458053Z","title":"- Check if the occurrence time is mentioned","venue":null,"work_id":"a63b0ae2-6182-4e30-9db2-7f375f0f7322","year":null},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.765758Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:2871d308e3c04d8288e7eec3cbfcb0ee2e47cc36655b72381e530b30f61aef74","observation_id":"28a12429-787f-48e2-805e-b199c7f94349","resolution":{"observed_at":"2026-08-07T15:21:00.510642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:00.316373Z","title":null,"venue":null,"work_id":"56008151-875d-4430-9f54-c338aee15450","year":null},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.845090Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:6282cbc78cabf04f4a8e5cef565895564074e08f2c98d0ed6ba35a327d7585d0","observation_id":"4940706e-4e41-4fd1-92a3-f8c3efbb7516","resolution":{"observed_at":"2026-08-07T15:21:00.388794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:00.218080Z","title":"mRNA\" and","venue":null,"work_id":"272d0471-bf5a-40a1-95c8-d49a61c4e035","year":2019},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.938701Z"},"links":{"citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:adab9b2d988a77f5682a14b5b873931f3be27b6be49ad62bce3d035890bc91c2","observation_id":"3571a2f4-bc9c-4d10-a20a-9d55c9d3ba98","resolution":{"observed_at":"2026-08-07T15:21:00.261706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 3 inbound Pith citation observations for arXiv:2505.15447."}