{"as_of":"2026-08-11T16:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eab50db58c49ec16d94475caa74e1a6b70b4e9e2adfedd4a3bf6cb67793e4071","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:29:51.391770Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:52:44.785582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:46:56.808179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"cited_work":{"arxiv_id":"2412.17415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17415","snapshot_observed_at":"2026-07-02T12:46:56.808179Z","title":null,"venue":null,"work_id":"905752a9-a88e-4770-ac8e-ab82a0850b05","year":2025},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2412.17415","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:ddad99a5bc8b6a9436da20b69292b9c68ed7961d3fc42c6159330f354864b277","observation_id":"4dccfb87-3f24-4aae-bd55-8b45679640d5","resolution":{"observed_at":"2026-07-02T12:46:56.809467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17415/citation-record","integrity":"/paper/2412.17415/integrity","json":"/paper/2412.17415/citation-record.json","paper":"/paper/2412.17415"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T05:29:51.251138Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.251138Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:383e42dbf4994ccf876fa563c9703c8653165f8b9930257cb02e55b93f4f15e6","observation_id":"36b59a45-b65a-4919-a5fd-3d4d50acf58b","resolution":{"observed_at":"2026-08-11T05:29:51.251138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T05:29:51.256797Z","title":"Video-llama: An instruction- tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.256797Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:3cdfd5cae3522a537f37fc1082fc1af534c6590a8b9cb70fd083288a5903d3da","observation_id":"a0b15ddd-9712-425a-8d9b-836f8593e592","resolution":{"observed_at":"2026-08-11T05:29:51.256797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T05:29:51.261821Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.261821Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:91c0752736f145079904f681938afa464ed19c4ddca31bf085befde9fa8e0160","observation_id":"d862ea53-59ad-4fec-a7e4-5741daf06e7c","resolution":{"observed_at":"2026-08-11T05:29:51.261821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-11T05:29:51.267504Z","title":"Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.267504Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:3cf392d2c1b72641f30e2b51167dfd23df144047a0da0529c3f4fd7322f1be22","observation_id":"976db303-747f-4c80-bb8d-17d02eaadee7","resolution":{"observed_at":"2026-08-11T05:29:51.267504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.855648Z","title":"Mvbench: A comprehensive multi-modal video understanding bench- mark,","venue":null,"work_id":"b964f672-977e-41bc-b4eb-5135dbcb2462","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.272473Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:c243133af287d0bb4e83ddbc84064c42d9888bbdb4d38968a33d369fa6a2eb80","observation_id":"2cec20e0-c2b2-46ca-926a-2cd54c61a4e0","resolution":{"observed_at":"2026-08-11T05:29:51.860581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T05:29:51.276954Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.276954Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:4a1d5175917a291c8442115da6a08bd9891899438a4899ef87f7d80a483f1041","observation_id":"34d2f7df-a516-4953-bf2c-2d7e264b4e14","resolution":{"observed_at":"2026-08-11T05:29:51.276954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-10T11:36:03.411225Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-11T05:29:51.282682Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.282682Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:2120d98190b97eacf4158d3199269ca66a3f4ef1b683ae41eb7795e94315e7f2","observation_id":"7f5ca850-f005-485f-bcec-d2d08ccae1fd","resolution":{"observed_at":"2026-08-11T05:29:51.282682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.841404Z","title":"Self- chained image-language model for video localization and question answering,","venue":null,"work_id":"a853896e-37e5-435f-ba76-aaf0b316db37","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.287475Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:7087664a6e9ab46b3005e8487c0b9a212c12195828e3dcf380849d96c9a96563","observation_id":"b73ffffa-6723-4754-8183-1b97d3d9654e","resolution":{"observed_at":"2026-08-11T05:29:51.846020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-10T11:56:12.145224Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-11T05:29:51.291907Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.291907Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:0c2c9b632381eb3eda0bf09c9eedbef33ef8345f161774fca08213958fa136ab","observation_id":"e782af15-4a88-435d-b6b3-b7598ae1a837","resolution":{"observed_at":"2026-08-11T05:29:51.291907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.826797Z","title":"Videoagent: Long-form video understanding with large language model as agent,","venue":null,"work_id":"47eb4a8a-836c-4123-8059-dc22d01819d8","year":2025},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.296639Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:f8c51afce75194261ef6a4375c6181b86b6d64e3e60b4a6ea7ae4c344d4d4abe","observation_id":"92a4f946-5951-4242-9af4-05643838b515","resolution":{"observed_at":"2026-08-11T05:29:51.832421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-08-10T11:57:05.068914Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-11T05:29:51.302286Z","title":"A simple llm framework for long-range video question- answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.302286Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:e425899e6df7434e6b63e648b44785c29871aa99b2276bfec32cb195042e6a17","observation_id":"779c2b7a-300b-454d-b289-4758696ef7eb","resolution":{"observed_at":"2026-08-11T05:29:51.302286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-08-10T16:52:41.065205Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-11T05:29:51.307324Z","title":"Language repository for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.307324Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:910313a5690e82e50b3aad86cbd91b48e10de043e52726dfcdead669cff47ba6","observation_id":"fb9a8cb9-4666-4f03-af54-b49098b2ee9b","resolution":{"observed_at":"2026-08-11T05:29:51.307324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.812189Z","title":"Question-instructed visual de- scriptions for zero-shot video answering,","venue":null,"work_id":"78f94340-c611-4120-9064-749eabbcc15b","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.313074Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:e8316ab87fecc8a1ca2c07fe7d0230056e4e6827be6b3bd2b330f829e8ee79a5","observation_id":"daf1d424-5f21-4a3c-8b3d-d98dfa29eb43","resolution":{"observed_at":"2026-08-11T05:29:51.816975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14848","last_updated":"2024-07-10T17:01:37Z","snapshot_observed_at":"2026-08-06T06:21:41.245457Z","submitted_at":"2024-02-19T16:04:53Z","title":"Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14848","snapshot_observed_at":"2026-08-11T05:29:51.317436Z","title":"Same task, more tokens: the impact of input length on the reasoning performance of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.317436Z"},"links":{"cited_paper":"/paper/2402.14848","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:78bee879cbb6ed54f4beea5ee44933d71d5b4b6d1e04f743612e5a0583388718","observation_id":"84ac54d0-55df-4757-a43e-2305ddb96686","resolution":{"observed_at":"2026-08-11T05:29:51.317436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.797849Z","title":"Large language models can be easily distracted by irrelevant context,","venue":null,"work_id":"6308b757-821c-4239-9a6d-5c1afeadf938","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.322333Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:02e8f6fa60b41c9889f8841ab37209b64cad336c24a74ecb13144d52f20fa1ef","observation_id":"6736c950-611b-4dab-ad9e-ced58d2443c2","resolution":{"observed_at":"2026-08-11T05:29:51.802738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.781606Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":"ffad6022-4971-449a-a54c-ad06f9d85965","year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.326968Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:fa7899b91fd7f9f08767a4de2c26d5bd16b2cfedb2ddf736692f6c67321276f8","observation_id":"db2d6455-f26a-4ea6-bc2a-23a4cd9236ee","resolution":{"observed_at":"2026-08-11T05:29:51.787037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T05:29:51.331502Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.331502Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:b6e7f4bbfa540cc85c8b746bb58ff49bd383e5d298cc56ca66ea579de84ceaaf","observation_id":"5e862572-2f5e-4d59-b473-7d4514489060","resolution":{"observed_at":"2026-08-11T05:29:51.331502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.766774Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal rea- soning in language models,","venue":null,"work_id":"67c9402c-4dea-4b6d-8bd8-e459f37aa25f","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.337272Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:6d270c553c3897a4255625a71db61fe7b4c5531234f5bb75f3eb411c08de1c18","observation_id":"f1290a7d-a931-433b-a740-3d6bc81295ca","resolution":{"observed_at":"2026-08-11T05:29:51.771872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.752042Z","title":"Enhancing multimodal sentiment analysis via learning from large language model,","venue":null,"work_id":"d1e4a73d-09c1-4ef3-87c2-26cbdaf3ad98","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.341609Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:cbb8484b37b891b4914ea4f0dcb16c717884991ec81703eeaae0bb2ce8a2bd81","observation_id":"c3947363-3c7c-4dd3-b60e-3dc3edf60c6b","resolution":{"observed_at":"2026-08-11T05:29:51.756953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.737344Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition,","venue":null,"work_id":"ab232691-069a-4c58-9146-72ea52fc9ffb","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.346135Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:d523e423fa066289a64efcd8bc8e339c23ec0d82a596297ccc0e8c2270811ffd","observation_id":"bd9a91da-8403-4e3e-90cb-d3d9c73af29a","resolution":{"observed_at":"2026-08-11T05:29:51.742345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13627","last_updated":"2024-07-13T22:10:57Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T17:44:24Z","title":"Vamos: Versatile Action Models for Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13627","snapshot_observed_at":"2026-08-11T05:29:51.350899Z","title":"Vamos: Versatile action models for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.350899Z"},"links":{"cited_paper":"/paper/2311.13627","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:a7af09bc20ad0faaba2754c0a3b7bf9810a6dc6089b118f213bbd86adb73667d","observation_id":"3e5aa05f-549f-4f40-9081-d470ee0498b7","resolution":{"observed_at":"2026-08-11T05:29:51.350899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.721525Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":"ffb5c7ed-8d68-4bca-b9c0-d222f6255d77","year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.356308Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:e36bc1df59230d14146b4bee1d8662bc07307472efb9a93b5969fa4fd3e7ea1d","observation_id":"81f5fac8-7b5a-489e-bab4-c6a35ee3a06c","resolution":{"observed_at":"2026-08-11T05:29:51.727217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.704004Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"025e567e-b016-4369-aece-3788ec4439ce","year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.360643Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:6c3cc30a61a8a05c5806683a25c824e36637a191d6d6a80b439c927cb646565d","observation_id":"7e21f624-5f9d-4657-9b4b-40809b13690e","resolution":{"observed_at":"2026-08-11T05:29:51.710596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.686718Z","title":"Compositional chain-of-thought prompting for large multimodal mod- els,","venue":null,"work_id":"7c33142f-6a81-40af-8d57-b002f65a7a2a","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.364961Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:c6470cb79e5ecdc120048d9bd36ac9db7eb27ce34502f4fdb503de728b63c2c8","observation_id":"09818ffb-dafd-4aeb-a383-1fd0d3bc1f0d","resolution":{"observed_at":"2026-08-11T05:29:51.691893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.670345Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"7da7b159-dcf6-41ee-accf-335138264875","year":2021},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.369044Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:eb2178fe3a7f25943b842d94820a524b852a37e90308305f6eb81a34947fbbab","observation_id":"fa23c586-feed-418c-91dd-c826e7f0678e","resolution":{"observed_at":"2026-08-11T05:29:51.676088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.655003Z","title":"Intentqa: Context- aware video intent reasoning,","venue":null,"work_id":"5eef35ed-d6b5-4424-ae03-cdf87c194845","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.374146Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:fcdc6ff608ca87c5698da640d88555bd11b4ebb07b160f56fd36bfb931d4b5a7","observation_id":"ed5e1194-f9b4-4603-a465-a88004e6276a","resolution":{"observed_at":"2026-08-11T05:29:51.660083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-11T05:29:51.378423Z","title":"Star: A benchmark for situated reasoning in real-world videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.378423Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:7a562981ceaa190eeb19ca5cbcf377e1627bf9712841f29f30b8f36194eaca24","observation_id":"1dc03d09-aa3f-4fc7-b7d6-a78b825ce3d0","resolution":{"observed_at":"2026-08-11T05:29:51.378423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.638979Z","title":"Verbs in action: Improving verb understanding in video-language models,","venue":null,"work_id":"f0df215e-2be0-4cb9-ac28-cc00cfdfe2e3","year":2023},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.382519Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:c263a7ecc3db61a4882fc1a56d243f9325067f1d9f34c889154f362ed67876bf","observation_id":"29a74aa0-e440-4351-acaa-3a00735895d7","resolution":{"observed_at":"2026-08-11T05:29:51.644900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T05:29:51.387257Z","title":"Internvideo: General video foundation models via generative and dis- criminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.387257Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:1d06201223c107d3c58371dd92cf8889b7bf819d8c931db52463484d4099034d","observation_id":"527a5034-1726-4fac-984e-db07468774e6","resolution":{"observed_at":"2026-08-11T05:29:51.387257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:29:51.620084Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":"725d3eb6-6b6f-4fd1-91c3-9c155a10c064","year":2024},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.391770Z"},"links":{"citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:93285b4bee4e175f044fac1a222db00a912a81ce1e44cd5732ea7aea2673d190","observation_id":"199033f3-a787-4436-aa41-9da7e36fc172","resolution":{"observed_at":"2026-08-11T05:29:51.628488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T05:24:51.743510Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2412.17415."}