{"as_of":"2026-08-13T12:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:585d92bc91d2c31edfbeda87bf8221ee3314fce8a854e73b709a3e4f563ada63","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:22:35.965901Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.01009/citation-record","integrity":"/paper/2510.01009/integrity","json":"/paper/2510.01009/citation-record.json","paper":"/paper/2510.01009"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T13:22:32.864573Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:32.864573Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:73ab9477ef0f1dd40ef657aeaea9eaa183e07ac73030a55e8a7710b47f2fcce2","observation_id":"c1fa159f-0ae2-4cd6-827d-62e3c9089184","resolution":{"observed_at":"2026-08-04T13:22:32.864573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00525","last_updated":"2018-06-01T19:51:58Z","snapshot_observed_at":"2026-08-10T08:02:23.675597Z","submitted_at":"2018-06-01T19:51:58Z","title":"Audio Visual Scene-Aware Dialog (AVSD) Challenge at DSTC7","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00525","snapshot_observed_at":"2026-08-04T13:22:32.906404Z","title":"Audio visual scene-aware dialog (avsd) challenge at dstc7.arXiv preprint arXiv:1806.00525, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:32.906404Z"},"links":{"cited_paper":"/paper/1806.00525","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:7e5da4449d75d4873424b3c081b94c35067abb3e9858bf79baed9e280582b01f","observation_id":"d28358f7-6e0a-471c-bb90-8db79045d677","resolution":{"observed_at":"2026-08-04T13:22:32.906404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:32.959339Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:32.959339Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:b06fd61cd6dfcf32fae758a38ea176a49f6569da4349709d36dc970e4e6c492e","observation_id":"8eb72ff8-da18-4084-97c8-d18d3098e792","resolution":{"observed_at":"2026-08-04T13:22:32.959339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.042395Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.042395Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:b24d7132e0c4534e648a1188610ab00db6045934ae8fb5dfc58ecb0588476446","observation_id":"f771fd04-7b2d-4444-8768-5e7858c4cd8f","resolution":{"observed_at":"2026-08-04T13:22:33.042395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.104568Z","title":"Goldfish: Vision- language understanding of arbitrarily long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.104568Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:16a46f8b063596aa0b56fb689b0c6d1d47db91bcfafb4fa5f90c8e50b2522c8e","observation_id":"ab416c63-d1fa-4e14-9e0a-437d18f683c7","resolution":{"observed_at":"2026-08-04T13:22:33.104568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.188025Z","title":"Is space-time attention all you need for video understanding? In Proceedings of the 38th International Conference on Machine Learning, pages 813–824","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.188025Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:19b2c1931b1bc44fb9ad5d410ec87e7e228c0fa256b610be817efd99e2723f2c","observation_id":"13fa6ef2-939e-4d02-822d-ce5f3cc4761f","resolution":{"observed_at":"2026-08-04T13:22:33.188025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-04T13:22:33.250105Z","title":"Pali-x: On scaling up a multilingual vision and language model.arXiv preprint arXiv:2305.18565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.250105Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:fdd3a989b855784fbc1a45034725fe223e36b2048fa118ff5cab4dcbee2d54b9","observation_id":"dc12f8f4-c088-4f66-94bc-2f9d30b69dd3","resolution":{"observed_at":"2026-08-04T13:22:33.250105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.305690Z","title":"Vindlu: A recipe for ef- fective video-and-language pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.305690Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:c048c6ee453d2ac64ab87d1c306c6a83ad521995e6e15bd7617560a0f48c21c6","observation_id":"dcccc084-5db0-4ccc-bb78-657ac82e8683","resolution":{"observed_at":"2026-08-04T13:22:33.305690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-04T13:22:33.363413Z","title":"Transformer-xl: At- tentive language models beyond a fixed-length context.arXiv preprint arXiv:1901.02860, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.363413Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:0fd4aa52a25437123a1fbf62e18906b70cba21433c6de3a88462e0d73622072f","observation_id":"f8df1c74-c858-4cbb-bfa8-f46a40823712","resolution":{"observed_at":"2026-08-04T13:22:33.363413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.420144Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.420144Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:066dbc3d92ee15f6afa4380735ef2d71e8d25c38fd248ac8f4d0adb0a296e14d","observation_id":"0be4c9d6-cf02-4784-a35a-fa43352f0d1f","resolution":{"observed_at":"2026-08-04T13:22:33.420144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.471412Z","title":"Knowit vqa: Answering knowledge-based questions about videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.471412Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:89ac66ff59df39a81cfa4645d21046c067ea3b59afbc42456a00ac93c584e41f","observation_id":"bfaa2350-16c1-4ef5-8d5a-ba4f979d49a2","resolution":{"observed_at":"2026-08-04T13:22:33.471412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06105","last_updated":"2022-04-12T22:30:12Z","snapshot_observed_at":"2026-08-11T15:48:27.655895Z","submitted_at":"2022-04-12T22:30:12Z","title":"AGQA 2.0: An Updated Benchmark for Compositional Spatio-Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06105","snapshot_observed_at":"2026-08-04T13:22:33.529728Z","title":"Agqa 2.0: An updated benchmark for compositional spatio-temporal reasoning.arXiv preprint arXiv:2204.06105, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.529728Z"},"links":{"cited_paper":"/paper/2204.06105","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:0420727a8edfdedc90267e5a998d78cabfa293e82defd23c5733978e76096468","observation_id":"e13ff2d9-b68e-4c4d-9bce-c3afb6d3f4b4","resolution":{"observed_at":"2026-08-04T13:22:33.529728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.588211Z","title":"Reveal: Retrieval-augmented visual-language pre-training with multi-source multimodal knowledge mem- ory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.588211Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:081f28fc2a5d2114418eb62a284fdedd797710a2d5a920fcc8146cfe339852d6","observation_id":"1a62ce53-ac7a-4488-ad1a-10bb4b1ceaf6","resolution":{"observed_at":"2026-08-04T13:22:33.588211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.629803Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.629803Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:103df3d8f64d7baf61d132d690cd718049ae1031b0279c0887e67d29c336afe0","observation_id":"a829eb62-cfc0-4e14-8b83-8a4677c108ee","resolution":{"observed_at":"2026-08-04T13:22:33.629803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.689185Z","title":"Visual question answer- ing: Datasets, algorithms, and future challenges.Computer Vision and Image Understanding, 163:3–20, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.689185Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:49d2dd3c2da8ef68964da1e295ca6135e732913029b0cb7b45bc80bd45b7f3b4","observation_id":"33fb768c-b02c-49e9-9b1a-c66d0889da50","resolution":{"observed_at":"2026-08-04T13:22:33.689185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.773614Z","title":"An image grid can be worth a video: Zero-shot video question answering using a vlm.IEEE Access, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.773614Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:656f4013a956d22ba53ab5cbac340f7b19601678150b561f012f4a65cc3aba00","observation_id":"1704e858-929a-4b94-aeda-2aff16fb65db","resolution":{"observed_at":"2026-08-04T13:22:33.773614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-07-06T06:59:26.080263Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-04T13:22:33.816672Z","title":"Tvqa: Localized, compositional video question answering.arXiv preprint arXiv:1809.01696, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.816672Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:7522b34a0a74be17fff3f9acc3cf43ff921d8fa68e281edc6231658ab3265ffa","observation_id":"d0619942-7f50-4460-b84f-b62a7f3495d8","resolution":{"observed_at":"2026-08-04T13:22:33.816672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-04T13:22:33.874949Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.874949Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:af1d2463ba534bd140cf0ec29a05b22d90d076c5c16b5c52139d20ff65a00d4b","observation_id":"a56dd022-f6b6-4b89-b253-71bc8c61c996","resolution":{"observed_at":"2026-08-04T13:22:33.874949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.924245Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.924245Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:461fc8794c1d754bba2fd28bc8ad3f6b9f40448803ee222df2536816f20079fb","observation_id":"96318be8-ddff-4ddb-88fc-bc9c5f7b8dd6","resolution":{"observed_at":"2026-08-04T13:22:33.924245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:33.982304Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.982304Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:846d604d69c2a6d439b4f3b7842ef668a005cd8672f134e114d732c0e51ecce7","observation_id":"2ebd77bb-2af6-41d2-9d3b-68ddd1a43fd1","resolution":{"observed_at":"2026-08-04T13:22:33.982304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.060873Z","title":"HERO: Hierarchical encoder for Video+Language omni-representation pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.060873Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:edecdc6c8ea83ad6bdaed5ac8ff7fe822269f7858f4bb186f6c27c0bc2bbc13e","observation_id":"4b3eb857-445b-43f8-b62d-fb3afcfac7d1","resolution":{"observed_at":"2026-08-04T13:22:34.060873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.096438Z","title":"Video-llava: Learning united visual representation by alignment before projection.EMNLP, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.096438Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:ed4f3568b6fb09c7c7572a9f2bb453175420e55c848dbe98ce192ba42bf53577","observation_id":"230df3f3-e26b-4782-94b9-2932af801295","resolution":{"observed_at":"2026-08-04T13:22:34.096438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.150045Z","title":"Common- sense video question answering through video-grounded en- tailment tree reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.150045Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:c3237b8a5ddbd4bd0c838fb6344fee9e211ab6872d4df4c2946b9661106cb332","observation_id":"776dcebe-c3dc-4c7a-8907-93b65501d099","resolution":{"observed_at":"2026-08-04T13:22:34.150045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.208012Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.208012Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:e09732c6e03f2388500c70a90e98da6db1d015c5e68dbf76b500b7799b7a4a1d","observation_id":"91238d44-23f5-45e0-9537-c046fabea754","resolution":{"observed_at":"2026-08-04T13:22:34.208012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.252847Z","title":"Question-instructed visual descriptions for zero-shot video answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.252847Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:b7ab59ff8a7f3749ec883eae4776293504f9b02f2c1dfcabd1d77a7e724c3855","observation_id":"cc2e1ca2-8b63-4f5e-add4-4a821f048960","resolution":{"observed_at":"2026-08-04T13:22:34.252847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.335998Z","title":"Streaming long video un- derstanding with large language models.Advances in Neural Information Processing Systems, 37:119336–119360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.335998Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:9c6e62f3d84abd46c5f1979e08bba288a4ebf69b5c4bcbe3f5e5f81b3e967337","observation_id":"986407c1-5c37-447b-a358-0ae5bb9f5ce9","resolution":{"observed_at":"2026-08-04T13:22:34.335998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.387610Z","title":"Direct prefer- ence optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.387610Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:2caa4274fb29b74c7c5886fb327ad73c8a317056274de481656594433a6dbe46","observation_id":"35b22632-d826-47b1-b4fd-0e6c1e51a8f9","resolution":{"observed_at":"2026-08-04T13:22:34.387610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.441656Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.441656Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:b21ffb926df13ca8c97e4351f9f5436818cdc43582de71887d11e31d1fbfb3a3","observation_id":"b4624298-6b57-4ac2-a74f-d0f676cc4057","resolution":{"observed_at":"2026-08-04T13:22:34.441656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04119","last_updated":"2016-02-14T17:20:19Z","snapshot_observed_at":"2026-07-06T04:36:19.340532Z","submitted_at":"2015-11-12T23:06:42Z","title":"Action Recognition using Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04119","snapshot_observed_at":"2026-08-04T13:22:34.505843Z","title":"Action recognition using visual attention.arXiv preprint arXiv:1511.04119, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.505843Z"},"links":{"cited_paper":"/paper/1511.04119","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:81be0534170488421aa927d1a4f26ba7e26d29a14cf4b8106d8a6cea89a42953","observation_id":"d22ebfc7-ef6e-418b-af03-7c5fdf45f922","resolution":{"observed_at":"2026-08-04T13:22:34.505843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.560993Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.560993Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:642a76588ea6b6e24da9735aa452f257231cbe02c272c4d20657059acf5a3196","observation_id":"e1c2e0aa-9720-440b-b197-e7c5170677dc","resolution":{"observed_at":"2026-08-04T13:22:34.560993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.572884Z","title":"Modularized self-reflected video reasoner for multimodal llm with application to video ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.572884Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:1a7f0718c55a95e29ca16c93eb1c3c918bf4fda40992dcd0ea4dd4bab7c9bddf","observation_id":"dbb01734-afaf-43e6-9f72-eb607114c636","resolution":{"observed_at":"2026-08-04T13:22:34.572884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.602802Z","title":"Movieqa: Understanding stories in movies through question-answering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.602802Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:8ceed0e9c54a839a2f8160811bac9a6b5675a7e003ea3f40f8b5946943045c51","observation_id":"a26c2812-3d26-407c-b46a-4376dada978a","resolution":{"observed_at":"2026-08-04T13:22:34.602802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-08-13T04:39:37.073819Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-04T13:22:34.683325Z","title":"Mm- interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer.ArXiv, abs/2401.10208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.683325Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:ac147d77ffbd74d3602c8110a9dcf06fb3e032134de656933eaa43ca646fd46f","observation_id":"02b5ffba-2c35-4879-a1f6-5f492720c4b7","resolution":{"observed_at":"2026-08-04T13:22:34.683325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.801271Z","title":"Video- mae: Masked autoencoders are data-efficient learners for self-supervised video pre-training.Advances in neural infor- mation processing systems, 35:10078–10093, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.801271Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:9f1ca1c5ba64888f5daccddf21d4e2c25ec5d891af30a78cfad13c04ed007d6b","observation_id":"65826b61-f3c3-4dc0-a3cc-ab8cf5ebf585","resolution":{"observed_at":"2026-08-04T13:22:34.801271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:34.935141Z","title":"Fastvlm: Efficient vision encoding for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:34.935141Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:1f158dc0b5297680129127014b6aff1829f66d5becfa08a1f3b5ab99d8efaebd","observation_id":"9a34a74f-3e2b-405c-9619-8b161a62fbdb","resolution":{"observed_at":"2026-08-04T13:22:34.935141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.00859","last_updated":"2016-08-02T15:06:50Z","snapshot_observed_at":"2026-07-06T05:05:43.383925Z","submitted_at":"2016-08-02T15:06:50Z","title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.00859","snapshot_observed_at":"2026-08-04T13:22:35.057234Z","title":"Temporal segment networks: Towards good practices for deep action recognition.CoRR, abs/1608.00859, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.057234Z"},"links":{"cited_paper":"/paper/1608.00859","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:da541790f414edc7b70a37e7b35d0589d08195d51d8efa13d70f6ddeb21fd619","observation_id":"b6b1023c-47f2-4c5e-8eae-f3c77288b4ea","resolution":{"observed_at":"2026-08-04T13:22:35.057234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:35.180439Z","title":"Vila: Efficient video- language alignment for video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.180439Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:3f2464528fec273ff14efa8bed47e227f1b61380c18e51bd5eac841b0d0a2b56","observation_id":"49598a56-397e-4a7c-90b2-9d5a7e7f9b95","resolution":{"observed_at":"2026-08-04T13:22:35.180439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-04T13:22:35.256568Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.256568Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:96f8930c29c5af359e3ef60c3bc333b4c05ae1b7e27177db0997dc75d83ef8bf","observation_id":"4cab872b-e3ab-488b-b404-c942bc03d25f","resolution":{"observed_at":"2026-08-04T13:22:35.256568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:35.344552Z","title":"Longvlm: Efficient long video understand- ing via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.344552Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:ec4877747ae6eb803f02d632308a9700d08f95c840fee66f1fe1f9b7c10a219c","observation_id":"dc9d193d-3232-42ab-9b75-3bd67ae6e484","resolution":{"observed_at":"2026-08-04T13:22:35.344552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-13T05:15:32.116612Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-04T13:22:35.455844Z","title":"Star: A benchmark for situated reasoning in real-world videos.arXiv preprint arXiv:2405.09711, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.455844Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:8cd90dc4b299c1ce1563e4dcbd89cd02d566045fa726071631d19b5d4841950a","observation_id":"bccc7492-cf70-4dea-a402-134cf0aea9e6","resolution":{"observed_at":"2026-08-04T13:22:35.455844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:35.550061Z","title":"Adaframe: Adaptive frame selection for fast video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.550061Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:6410e0d42fd782a1e87d5459fd8b782bd6a517f7a99828bf6fbc55b53b6e78cc","observation_id":"29b384d6-847f-4ca8-9baa-7cd7870bde0d","resolution":{"observed_at":"2026-08-04T13:22:35.550061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:35.619397Z","title":"Next-qa: Next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.619397Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:90633ef4ed51722cec80718798555104762d59edf927309ab52592e4f9fc7466","observation_id":"286b7aeb-d09e-4542-85c9-27b73dd22711","resolution":{"observed_at":"2026-08-04T13:22:35.619397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:35.694555Z","title":"Zero-shot video question answering via frozen bidirectional language models.Advances in Neural Information Processing Systems, 35:124–141, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.694555Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:957f0244d8d7d700e029d79e5b3f845e28a6e39d3add43c7f2f8d11540ecfae0","observation_id":"1228da27-da17-4897-b1a4-2f6bdd2c8883","resolution":{"observed_at":"2026-08-04T13:22:35.694555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-11T19:42:36.266059Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-04T13:22:35.773784Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.773784Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:e54157bd07eb7672ab2d04ef889a55256311bcfc5e5931baf8ba71616af3cfb0","observation_id":"6d6a8ca9-fca7-4d50-a6d2-bf099951be2a","resolution":{"observed_at":"2026-08-04T13:22:35.773784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03009","last_updated":"2025-08-05T02:28:58Z","snapshot_observed_at":"2026-08-13T06:34:22.023345Z","submitted_at":"2025-08-05T02:28:58Z","title":"Enhancing Long Video Question Answering with Scene-Localized Frame Grouping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03009","snapshot_observed_at":"2026-08-04T13:22:35.874760Z","title":"Enhancing long video ques- tion answering with scene-localized frame grouping.arXiv preprint arXiv:2508.03009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.874760Z"},"links":{"cited_paper":"/paper/2508.03009","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:154651cf849a0c875fd028def8db5d9abe32f55e0e157db2ffaa65d94d6eec33","observation_id":"73be145b-6fc5-4477-a6ee-694af2d996e8","resolution":{"observed_at":"2026-08-04T13:22:35.874760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:22:35.965901Z","title":"Self-chained image-language model for video localization and question answering.Advances in Neural Information Processing Systems, 36:76749–76771, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.965901Z"},"links":{"citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:c890c2eb9eba7b5edbd0ab398964b72b380bdd44df1940f28d7dd94e8e9d6179","observation_id":"71ef35a2-c38d-4799-9ae0-68ffb6073932","resolution":{"observed_at":"2026-08-04T13:22:35.965901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2510.01009."}