{"as_of":"2026-08-16T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27340299aebe39a69c8b2804720ad5fef73981df90695e2872611b276945f078","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:18:53.143452Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:32:22.239838Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:02:34.105509Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"cited_work":{"arxiv_id":"2505.13429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13429","snapshot_observed_at":"2026-06-28T19:02:34.105509Z","title":"arXiv preprint arXiv:2505.13429 (2025)","venue":null,"work_id":"9fbd64d5-526a-4617-bd55-ff914c26cf8e","year":2025},"citing_paper":{"arxiv_id":"2606.00640","last_updated":"2026-05-30T09:30:30Z","snapshot_observed_at":"2026-08-12T14:25:46.113286Z","submitted_at":"2026-05-30T09:30:30Z","title":"An Attribute-Based Measure of Video Complexity","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T19:00:54.718177Z"},"links":{"cited_paper":"/paper/2505.13429","citing_paper":"/paper/2606.00640"},"observation_digest":"sha256:ab1770db532053862c567b88de8530a999a607e1253b18702d9b45ee7cfbf806","observation_id":"8a371f5e-a9cb-4c5e-89fe-76a533985358","resolution":{"observed_at":"2026-06-28T19:02:34.107311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13429","snapshot_observed_at":"2026-08-15T14:32:22.239838Z","title":"arXiv preprint arXiv:2505.13429 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06869","last_updated":"2026-08-11T08:50:16Z","snapshot_observed_at":"2026-08-16T00:29:47.173165Z","submitted_at":"2026-08-07T06:49:55Z","title":"DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:32:22.239838Z"},"links":{"cited_paper":"/paper/2505.13429","citing_paper":"/paper/2608.06869"},"observation_digest":"sha256:6d06718ea42d9f1e0e1dc06a74f1f1931c934d7e438dfaca969c1561c3ce7c9d","observation_id":"e4a04b15-1e58-4a35-83c1-cd3e39cf05e4","resolution":{"observed_at":"2026-08-15T14:32:22.239838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13429/citation-record","integrity":"/paper/2505.13429/integrity","json":"/paper/2505.13429/citation-record.json","paper":"/paper/2505.13429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:50.991012Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:50.991012Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:a9c8b788a1c403307ff784f1b2c6e20fefe74ecf055c71faf736d1878db52f87","observation_id":"89d10c2e-1c25-4f44-848f-5fe60e5a602c","resolution":{"observed_at":"2026-08-15T20:18:50.991012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.059253Z","title":"A shared neural substrate for action verbs and observed actions in human posterior parietal cortex","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.059253Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:564d3d85e976d6ce6712daed131afe8215d2074dc5cc1e12aa092d0d1fe45a51","observation_id":"0bd956ba-abd7-406e-9e0a-4b1cdbb95458","resolution":{"observed_at":"2026-08-15T20:18:51.059253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02818","last_updated":"2021-08-05T19:05:57Z","snapshot_observed_at":"2026-08-16T18:04:57.242101Z","submitted_at":"2021-08-05T19:05:57Z","title":"Evaluating CLIP: Towards Characterization of Broader Capabilities and Downstream Implications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.02818","snapshot_observed_at":"2026-08-15T20:18:51.064334Z","title":"W., and Brundage, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.064334Z"},"links":{"cited_paper":"/paper/2108.02818","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:b225d903516ed1d9b9321ca989cfd7d70041a10c26bff075eff1b4a1e55dee43","observation_id":"4e4bd6e0-9009-433b-9681-1475a3df77d4","resolution":{"observed_at":"2026-08-15T20:18:51.064334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.068935Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.068935Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:9a219ddeefc18c6179e0ca279b311871d05417b9a62b7b600b32784f002a20d4","observation_id":"cc8c7136-bec3-4ceb-bc97-11ae44aaad58","resolution":{"observed_at":"2026-08-15T20:18:51.068935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.072802Z","title":"Is space-time attention all you need for video understanding? In ICML, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.072802Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:4f615dc356d94f5bc699f574bc4517200550f4ab7b5c942515ad882247feec96","observation_id":"8a7bc1fc-7307-4c53-8d3b-808d616c1fc6","resolution":{"observed_at":"2026-08-15T20:18:51.072802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.076952Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.076952Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:a45e17e0b91d55c3b5f7b7ea493eb93874681a59d77ada77761199a58d500104","observation_id":"a0cf77f5-ca21-45f3-b652-b62bcca0071f","resolution":{"observed_at":"2026-08-15T20:18:51.076952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.081807Z","title":"H., Lu, P., Nocedal, J., and Zhu, C","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.081807Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:f79fbbcab8ed302b718e34b4314f28ac3369f11da4b696dd2f8a3f7976de1ffe","observation_id":"f7092f22-b78f-4178-9d96-c073b9fd1a44","resolution":{"observed_at":"2026-08-15T20:18:51.081807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.196727Z","title":"ActivityNet : A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.196727Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:e92559d42771a0f6574dc5bdd71f57ec657c14fe435be78444e3d989e7398f35","observation_id":"27f51f1a-24da-4516-addf-e93ff3112c37","resolution":{"observed_at":"2026-08-15T20:18:51.196727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T20:18:51.223294Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.223294Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:c7ac90be34e6061dd5a32bebbc38d93b16869678fb361a395569e9c08179c18e","observation_id":"7d088cd8-c151-44b2-b710-7a69da522442","resolution":{"observed_at":"2026-08-15T20:18:51.223294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.227980Z","title":"E., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.227980Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:4d3fc2b94ef19fb4d72eb7fc0556f3529cc583c5d9e6ef4a27884770ad85e77a","observation_id":"60cc9b1c-45ba-4a8b-b171-89c597e44e29","resolution":{"observed_at":"2026-08-15T20:18:51.227980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.231760Z","title":"and Gr \\`e zes, J","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.231760Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:d7314c4e3eb6ab1a33282fb145f2269a4c11f901ae66bf36bf047275b54c302c","observation_id":"40d5f1a4-85a6-4567-9246-d9a0ef99a0b7","resolution":{"observed_at":"2026-08-15T20:18:51.231760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.562258Z","title":"Brain activity during observation of actions","venue":null,"work_id":"49dc2317-b60f-4f9c-a909-db79bcd4131a","year":1997},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.235391Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:a381d02d2f34e7a807afd4f560c1a26ee90a6d29b5d44431930042f07bc4b7a2","observation_id":"1b166968-310d-4ddb-a329-fb8689f7c3ea","resolution":{"observed_at":"2026-08-15T20:18:56.566769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.548155Z","title":null,"venue":null,"work_id":"592c0aa0-6819-4f4a-aefd-da6018fb4ae5","year":1967},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.240031Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:132882870ae125c36e08b0b33eae6d448c56c9bc5cc4d4e52132991cac9b3f4d","observation_id":"5887e24f-ebc2-42d2-ac0c-16ec36401406","resolution":{"observed_at":"2026-08-15T20:18:56.553800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.517699Z","title":"K., Winn, J., and Zisserman, A","venue":null,"work_id":"4158f42a-bc10-436e-95eb-88601113c9a9","year":2010},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.244319Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:3d018a3b1d2074a6972925a563178fa4f3d10133caaf900c4152f3bc10620f2f","observation_id":"ca03a4fd-f291-4ce6-b059-8afaa07ecb69","resolution":{"observed_at":"2026-08-15T20:18:56.540693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.345956Z","title":"and Soto, A","venue":null,"work_id":"f5c2a511-f469-4817-b0ac-7722fcd14c22","year":2020},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.310511Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:dff149e9f5fab2afa6e439590b71f2bafdcc842cb531b16a4ee6a7026415f5b7","observation_id":"7130db4c-09a2-4529-ae70-5129474e11da","resolution":{"observed_at":"2026-08-15T20:18:56.413268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.326205Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"4716fc34-26cd-4e81-a4fe-35de5c81f601","year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.313786Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:faf74a81ec0930ad01d1c7b03b4a4a9875b310671294293d22f70597c8282007","observation_id":"d2e8376d-b64f-42d8-919d-f2117f9d7be6","resolution":{"observed_at":"2026-08-15T20:18:56.329880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-15T20:18:51.317153Z","title":"GPTScore : Evaluate as you desire","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.317153Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:20cf29c408ff7e85daf55d686ccd3d2415449f647cf0008222aac601fa323a4b","observation_id":"ecacacbb-e0c7-4e8b-921e-e8b30b1338f9","resolution":{"observed_at":"2026-08-15T20:18:51.317153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-16T17:39:33.161354Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-15T20:18:51.322345Z","title":"Y., Wang, L., and Liu, Z","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.322345Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:4353f707501f2844be2f16318a5ab66ef3e522cc0f6fa7cf849858d094f19b7f","observation_id":"0fa37ad3-6d7a-43d0-bcc8-f59a618acda0","resolution":{"observed_at":"2026-08-15T20:18:51.322345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.315077Z","title":"Recursive visual programming","venue":null,"work_id":"25e1ab2e-8841-4c72-b5d5-b56e18e2381c","year":2024},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.392721Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:2c490f4d307015738c8a909e210efd8e312931a68625556051c7078792ccbd5c","observation_id":"c108a262-3a8f-4caf-8cd2-0b48b7b7fc61","resolution":{"observed_at":"2026-08-15T20:18:56.318898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.188895Z","title":"Adaptive computation time for recurrent neural networks","venue":null,"work_id":"fd94d2e6-d444-4392-8f92-fe724eefd066","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.477662Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:9ec65ef6bd3512348ef4abf95ee299bbfa0fb46cce3c74859927a55e5ecc2869","observation_id":"b0e85dfe-50ca-49f7-af29-7c23e729e380","resolution":{"observed_at":"2026-08-15T20:18:56.308405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.180029Z","title":"AgQA : A benchmark for compositional spatio-temporal reasoning","venue":null,"work_id":"4febb1e5-32b6-4e7f-95f9-1e1a7844ffea","year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.544947Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:9468faffd15f8131f158c6293ddc793e3f319e2800d4010befd86331dd3fa730","observation_id":"1fd69439-8776-4337-9730-9ad50c48a07b","resolution":{"observed_at":"2026-08-15T20:18:56.183194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.171860Z","title":"and Kembhavi, A","venue":null,"work_id":"de378c66-b560-4c21-97fb-09c706ece4a7","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.549995Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:1a5e2e849e30ed336d8e378b89535eccb4eeecf06866971f495cba152a59921a","observation_id":"0765632e-91f3-44ac-b645-9ed3a96339d4","resolution":{"observed_at":"2026-08-15T20:18:56.174661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.028613Z","title":"V., Sethi, R., and Ullman, J","venue":null,"work_id":"e3c8f1ed-70c5-41df-9d05-41797e2357ab","year":1986},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.553834Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:6dc1b84a26a29163cfc3d3fce1eff3c87af86e0fe1efc029f833a1eaa009ef41","observation_id":"77b9ce6b-182f-48ed-83b7-62ea30d7dc28","resolution":{"observed_at":"2026-08-15T20:18:56.140553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.018574Z","title":"Learning to reason: End-to-end module networks for visual question answering","venue":null,"work_id":"cb947eb1-88ac-4145-891b-7249820ce836","year":2017},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.557803Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:16cafb4e7c456c59757d1385480603ebf7e6fe2cc3a9cdc7464d8baacbc15a6e","observation_id":"bb2e49d6-2f87-4124-8aa8-6bdd98dfe28a","resolution":{"observed_at":"2026-08-15T20:18:56.022028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:56.008111Z","title":null,"venue":null,"work_id":"77bf8a54-67e7-42e7-8569-c9c0b5800dbd","year":2018},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.562304Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:a6188a26c183434da1c30d656e16aa72e93c0d2f4ec85e62814731ca3940b56e","observation_id":"db603616-1975-4174-a68f-6b4da6f4e151","resolution":{"observed_at":"2026-08-15T20:18:56.011441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.996291Z","title":null,"venue":null,"work_id":"3db90430-08c9-45fe-a59f-e5135a339dd7","year":2019},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.566362Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:6b9ad4c1b27cd24cabcaac7e2223a6f892c1923c7fcfa60290ebcfd70fe916a2","observation_id":"b11e4c7e-41b0-48a1-acb0-8711aed44e0e","resolution":{"observed_at":"2026-08-15T20:18:55.999582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.898396Z","title":null,"venue":null,"work_id":"f093024d-7599-432b-864d-a4c81c6e4d18","year":2020},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.571755Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:35dd98954fc1060e8fd044adf28ad7e36567f2237669d7104d11c100fad85987","observation_id":"bad9a63c-f821-409f-9078-d7a0fd2d04a1","resolution":{"observed_at":"2026-08-15T20:18:55.990558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.794239Z","title":"and Han, Y","venue":null,"work_id":"5d416159-62e9-4588-80cf-6191349c83cb","year":2020},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.636026Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:5d5d73437f20b73a0cc1b2b5d8e14e1f65a9effd7cca23957a2b58537a5238a6","observation_id":"7be27510-0989-4a80-a577-fae7d25c3287","resolution":{"observed_at":"2026-08-15T20:18:55.831349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.784077Z","title":"CLEVR : A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"831e89e3-5293-48d3-86e8-f463d664abb4","year":2017},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.682106Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:b8ed6204e32881dae222311578a40f6321077bc373e7027945ffadb10e9004bf","observation_id":"52d0685e-e369-426c-8407-dc37a16de43f","resolution":{"observed_at":"2026-08-15T20:18:55.787570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.774358Z","title":"Inferring and executing programs for visual reasoning","venue":null,"work_id":"ddf79b07-caf0-4e69-9dcd-b61e4763db91","year":2017},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.780729Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:fc56c37bddbe3f69d004e3481240a4d80a152cf5510ee1b9a580fa007c573098","observation_id":"a4a7cd14-7886-4e6f-bf97-dabeafb351df","resolution":{"observed_at":"2026-08-15T20:18:55.777869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.712403Z","title":null,"venue":null,"work_id":"c2192fea-1ff4-462e-9617-0c02a2ae61f7","year":2019},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.784668Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:57c9b2c251f716110e54a2cde79ccedeb23d88c5709e2a2c4fe8fa1a6756dbd8","observation_id":"b0c07739-aa8c-4d9d-8cd4-07464fbab446","resolution":{"observed_at":"2026-08-15T20:18:55.766798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.684477Z","title":"W., Tapaswi, M., and Fidler, S","venue":null,"work_id":"dfab56e3-fe3e-4a8f-b437-138ddc64ef96","year":2018},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.788366Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:f2be19b0551a979ee32c0d54d3fd3a42c678d322287b9f0a2526959f692f3e52","observation_id":"cf7058e5-aedf-4cb1-9b87-09d8d8c7e458","resolution":{"observed_at":"2026-08-15T20:18:55.688625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.673794Z","title":"and Bojar, O","venue":null,"work_id":"23b7f0fe-fe40-4529-9e40-9dc04bd544ad","year":2017},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.791691Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:0c19a4cffc6b873999772bd12fbcd5acb74a1e392b7df72b8d2f5010fdc33787","observation_id":"c3beb552-4555-4324-a1cd-0a9299354cdb","resolution":{"observed_at":"2026-08-15T20:18:55.677424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.653883Z","title":null,"venue":null,"work_id":"07907c6b-cc87-4058-8775-53772948fd6d","year":1963},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.796153Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:cbf8db74733b28e20e39d2ff3876b6db6bf5adaabc158338a42032edb3243bf9","observation_id":"99390403-e02d-41ab-9bb4-aa4900e56ad2","resolution":{"observed_at":"2026-08-15T20:18:55.664823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.513080Z","title":"and Kramer, O","venue":null,"work_id":"978c20d2-bedc-449a-a40f-4f4a8e3edaae","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.801724Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:a3b83a0f520fb77dd32f22e812012f039211ec24cbbf56a0ac2afbed6457c258","observation_id":"59170970-a60e-427d-b6ea-254d76a67255","resolution":{"observed_at":"2026-08-15T20:18:55.586622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.500867Z","title":"Dense-captioning events in videos","venue":null,"work_id":"95ce4996-b59d-489a-bd89-4ee2e42fdca7","year":2017},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.806322Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:c15058897d1c99258cfdfb20e8046118091f2c1dfbc649fe2a1d524571c1cb38","observation_id":"eb2bc160-0bf3-4a8e-94f7-99ef0991233a","resolution":{"observed_at":"2026-08-15T20:18:55.505228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.486985Z","title":"BLIP-2 : Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"c3d48a95-7e36-4286-bd1b-85ff618cdd44","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.897852Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:88394e00d5e85a9bd4e682d9e707815ce8b8d019a93bebdb738b5987be1f3680","observation_id":"b345012c-50fb-41b0-bbc4-56890447f830","resolution":{"observed_at":"2026-08-15T20:18:55.491312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.376528Z","title":"MVBench : A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"b4afe678-31e8-4aa5-a312-371196a5043a","year":2024},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.973337Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:4709910991bf2b393a35c1c9dd0706033e93dc61cb31a96899c6d6e0f75931f2","observation_id":"6004c26b-7436-4087-bf83-ba831b93b451","resolution":{"observed_at":"2026-08-15T20:18:55.440557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.976804Z","title":"A technique for the measurement of attitudes","venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.976804Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:73a939d1b638893173e0b0b50fa99ce3d03e0d8a9813b1143f7ed1795727f61c","observation_id":"08bbdb7b-4e67-43fd-9767-878955cf28ac","resolution":{"observed_at":"2026-08-15T20:18:51.976804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.356073Z","title":null,"venue":null,"work_id":"4757de91-8426-4aa7-ac49-00c77e8a510f","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.980311Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:54a147c485483d9d73ce58e1e9b064f958e6fe4de01587642f0cadf50b0e1057","observation_id":"d852b290-6d99-4c5b-aa41-734f0a6094bc","resolution":{"observed_at":"2026-08-15T20:18:55.359443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:51.984196Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.984196Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:61edd47f85a8d447a29e1af04bc75ee99c4f3bbe0f49a7966a5e4acb44444943","observation_id":"7e17724d-cf08-4d74-af08-42ae8fdd86df","resolution":{"observed_at":"2026-08-15T20:18:51.984196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.336898Z","title":null,"venue":null,"work_id":"2a92e894-b40a-46f7-af66-16e89f0aaa77","year":2024},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.988101Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:a4c6c20f28ae8e6ae9689fac2324dd993d387a909c7bdb50e77f6527435b6507","observation_id":"0ccd3f8a-0eff-47ba-b4fb-0de746ebedaf","resolution":{"observed_at":"2026-08-15T20:18:55.341479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.325227Z","title":"L., Nejadasl, F","venue":null,"work_id":"7c12faa0-cfea-4a71-99d9-4b0af1a8ead5","year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.992410Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:7cfb0b520202eb15be3fe8cae0da91342add62dc06bc2856c2be582ac33588ee","observation_id":"ad5bd453-9680-40d6-b2c8-8c243b968d21","resolution":{"observed_at":"2026-08-15T20:18:55.328942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.259291Z","title":"C., Adeli, E., and Li, F.-F","venue":null,"work_id":"a35a542b-2add-47f3-b35e-6cf9f7cf4d3d","year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:51.996538Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:02bf415a7fabf292ba0a6076d8994e34058ad5f1c0a9032edc8f5c07b848c085","observation_id":"1a2eef59-ab74-4526-aee2-f79c3c8ecddd","resolution":{"observed_at":"2026-08-15T20:18:55.294349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.248424Z","title":"Y., Wu, J., Niebles, J","venue":null,"work_id":"670f33ff-873d-4cbb-a217-3ced9392e074","year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.154088Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:362a52813601e4f09c37a62178b1d34ff6f50b30ac6278dc585b2b7c6f12c57e","observation_id":"4e3f0a8a-6d99-4add-8081-45b11def5ea2","resolution":{"observed_at":"2026-08-15T20:18:55.251931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-16T13:43:12.933116Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-15T20:18:52.268106Z","title":"VideoGPT+ : Integrating image and video encoders for enhanced video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.268106Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:ea1a7cd498d4699c9f056a3638b392a2574564600c7e473d4bb94e53c7ceee20","observation_id":"2956f30d-8cff-437f-bb74-40007ba61fad","resolution":{"observed_at":"2026-08-15T20:18:52.268106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.237241Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"639e6e88-6ee8-4d3d-9397-70af92cd554c","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.272442Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:1b3397f8b4ce3ddd4f4a7dd223cb8072da122128ba80436bcbe55cad5bf5c85f","observation_id":"04dd940f-c62f-4b38-98a0-001d23921706","resolution":{"observed_at":"2026-08-15T20:18:55.241956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.225728Z","title":"EgoSchema : A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"08f7af59-5508-493a-bb26-19125405677e","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.276215Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:c4ce947ce7348027e3b01183e55139ef92412d64451cc6b1f0d347b0dc9fbeed","observation_id":"3e63888b-157e-4a7b-8945-445c70b22ef1","resolution":{"observed_at":"2026-08-15T20:18:55.229170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.214897Z","title":null,"venue":null,"work_id":"5b372fcf-0961-4bb7-9462-5a43c541664f","year":1976},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.281674Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:fbd13fc2d34dc5d1d5d75c86d8fe19bc9f42cdd7f1e7313427665538bfe64f9f","observation_id":"157573ae-15cc-4564-a454-05c2a6117481","resolution":{"observed_at":"2026-08-15T20:18:55.218861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.111715Z","title":"and Vondrick, C","venue":null,"work_id":"6beab9ba-7638-4359-99c8-dbf22f95f04d","year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.285183Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:fef6badcd0a215b373dba81ff2c62d511a03f793fa7bf2ca5b6bf8a90f0d29cc","observation_id":"bd40ece6-92b4-4b2a-b863-56dd25c2bbb5","resolution":{"observed_at":"2026-08-15T20:18:55.179229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.080288Z","title":null,"venue":null,"work_id":"a2dc7717-d7f8-425f-bd4b-9409c177fc94","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.290047Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:70cf743e94039afa5636e634fd4407dd2ea32e3df6cef2d1b39bcb99bbb29e1a","observation_id":"0f745b9c-c4a7-4e3a-936d-d8e0b923dc59","resolution":{"observed_at":"2026-08-15T20:18:55.084828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:55.068424Z","title":"GPT-4 technical report, 2023 b","venue":null,"work_id":"7747c72a-3e91-40e7-bf4e-7dc36ae5833f","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.294290Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:8f6930d1eca24523a4a257d15fff9db5a522fb454bf2eaaab69708d4c0651c85","observation_id":"4abd0291-46ce-4fce-bd37-46f94e1b3f70","resolution":{"observed_at":"2026-08-15T20:18:55.072753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.943880Z","title":"and Schitter, C","venue":null,"work_id":"bb77f3a4-8a2a-4066-af90-717e9fe20ebe","year":2018},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.355937Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:ad61f348d5d4c92a8c382e5d6933bf885435d8843fec517e71413b6167c7b3fd","observation_id":"c016c4a7-fb51-4f2e-83c6-d55dffdf232f","resolution":{"observed_at":"2026-08-15T20:18:55.035573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.931288Z","title":"A., Stretcu, O., Neubig, G., Pocz \\'o s, B., and Mitchell, T","venue":null,"work_id":"082cc27a-b21e-4ec4-8608-1bac12ea1ef5","year":2019},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.439614Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:6b1aeb8b6c1a25d5fdf3d66f0878df4f023096b4bcd9f9d459b3e90fed821817","observation_id":"ca391c39-d642-4a39-be9c-1360b4519c2f","resolution":{"observed_at":"2026-08-15T20:18:54.935382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:52.505588Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.505588Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:c969ba3ee3d0df1c5f47bbf0baba5d72e7fa67f3245b2171d8079c1868d97eac","observation_id":"9bb79496-4021-4868-be98-b342926e1830","resolution":{"observed_at":"2026-08-15T20:18:52.505588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:52.510472Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.510472Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:90110cb493893c72caed74a9c810ee40dcc89341950ddf6a4f7b23daa39a1bb7","observation_id":"66c93eda-5306-4770-b782-9afe71995b4d","resolution":{"observed_at":"2026-08-15T20:18:52.510472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.855337Z","title":"Annotating objects and relations in user-generated videos","venue":null,"work_id":"0ee15c8e-88fe-4140-b662-84a679b1a8cb","year":2019},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.513979Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:56d69dc4bb13c91d3731480be21fbea62c9d29bca47fdf389a72c3c851b05453","observation_id":"42d4c87c-6a6a-44b6-827e-3703364546a6","resolution":{"observed_at":"2026-08-15T20:18:54.892020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.830951Z","title":"HuggingGPT : Solving AI tasks with ChatGPT and its friends in hugging face","venue":null,"work_id":"9fc8ec77-90aa-4a45-8c9e-9027b8037c2e","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.517327Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:113710b81c11ffc2965cda17e279131e455e2f3fe05055bb487c3778b793bf96","observation_id":"2d485fa0-c56d-454b-b223-ea5a89d6485d","resolution":{"observed_at":"2026-08-15T20:18:54.835259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.778803Z","title":"A., Varol, G., Wang, X., Farhadi, A., Laptev, I., and Gupta, A","venue":null,"work_id":"e3c2f01b-a00f-4d2c-a290-a97e37ae4970","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.522238Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:282832406967abad415dc5296c1a1b4aa6d573571826dd599ce584c917a1a895","observation_id":"fb75f1b2-6544-412a-8f2e-20e9e56f825f","resolution":{"observed_at":"2026-08-15T20:18:54.821822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.694978Z","title":null,"venue":null,"work_id":"e1e5dfc0-8bcd-40d8-8171-40cabb50249c","year":2009},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.526964Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:c9eceb37aec323836893959ec381dbe29beae3e0fd580e93110efad59b52c131","observation_id":"bf749fed-8985-4223-b74e-56a9e968d7a8","resolution":{"observed_at":"2026-08-15T20:18:54.729547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.682251Z","title":"T., and Leordeanu, M","venue":null,"work_id":"19d3f00f-f74d-473b-ab96-a666960f2e0b","year":2020},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.531242Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:eadcaf83f19176d2fb861e1de02367066250ca94255a031966d5ff415022140f","observation_id":"f403c41a-248b-4a1e-a39c-ce172b6e01e8","resolution":{"observed_at":"2026-08-15T20:18:54.687545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.556614Z","title":"less is more","venue":null,"work_id":"3754e3b8-6e0c-41dc-a247-bc5958348255","year":2010},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.535344Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:95a0bacf21c9f638f1396ffb8807252c6999846d15241d0e6a04a7a13a04c4e1","observation_id":"86f92031-0c26-4206-bfcd-adab7d323854","resolution":{"observed_at":"2026-08-15T20:18:54.616302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.544568Z","title":"Modular visual question answering via code generation","venue":null,"work_id":"22a35c0b-450b-4e4c-bf05-5276cca76048","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.616141Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:fa2adab119fa775ce8ae8e63125cecc542fda0ef70e7fad0d92e22aa39ee5985","observation_id":"6719b62a-8ec8-449d-ab37-3ca6793abaa9","resolution":{"observed_at":"2026-08-15T20:18:54.548302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.533083Z","title":"ViperGPT : Visual inference via python execution for reasoning","venue":null,"work_id":"729159e2-e171-4970-9731-493819e008a1","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.677195Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:bb4e991864fa71556edbec00340cfe803e9e2678e5b692f4d25a43828ebd51c5","observation_id":"ca8dff22-2529-4b59-8ff5-755e67f4c2ac","resolution":{"observed_at":"2026-08-15T20:18:54.536876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.448006Z","title":"T., Fu, J., Phan, M","venue":null,"work_id":"1e4a26a2-d592-4491-ab07-8d531ebcc07f","year":2019},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.680634Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:432d0ad94005ac56734a303230bc7127280b9bcf9972808a9728738b8054e048","observation_id":"fcb49ab8-56ad-40a6-a2ba-042cc377d8ee","resolution":{"observed_at":"2026-08-15T20:18:54.472736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.437642Z","title":"A., Friedland, G., Elizalde, B., Ni, K., Poland, D., Borth, D., and Li, L.-J","venue":null,"work_id":"eaa02f9f-c0dc-465d-bdf7-34daac1fdaea","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.684219Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:bfdd2f986faa01174346b0dc3f941994dc976ec77dea45d7303b29c8737e09c3","observation_id":"9b720306-7b7f-4986-94b3-e57a2bb6c320","resolution":{"observed_at":"2026-08-15T20:18:54.441325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.426737Z","title":"Learning the curriculum with bayesian optimization for task-specific word representation learning","venue":null,"work_id":"051196ed-7509-47ee-8fe9-c5cd71bfcfc5","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.689888Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:4c0b1242ce789caf538688411fcb5418fb05d0c85c06b2083d0feb2db092d101","observation_id":"f9125a1f-35b7-4ff1-83ea-0b0b3f591949","resolution":{"observed_at":"2026-08-15T20:18:54.430869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.404141Z","title":"Learning the curriculum with bayesian optimization for task-specific word representation learning","venue":null,"work_id":"45eeebd4-b649-4771-9a35-dd41947ab94c","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.693265Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:97e8bb17a6a38c0b047dd1264b9fbae45e248545f3e2a01cbf361d8d0a031dcf","observation_id":"16537687-d975-4425-be25-714d1e1780e8","resolution":{"observed_at":"2026-08-15T20:18:54.419868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.391661Z","title":"P., and Ferrari, V","venue":null,"work_id":"f05cfbb6-e18c-45d3-b27e-2a92d8fb2643","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.697978Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:61a9eaed982bc3ade33f96496b18cd9458cd71339a119121d3abf5b47f25efd8","observation_id":"d4511928-59ec-49e5-b35c-d7b93c0d0c51","resolution":{"observed_at":"2026-08-15T20:18:54.395810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.278253Z","title":"Neural discrete representation learning","venue":null,"work_id":"52f71eb8-8e24-45b5-a7ad-3d87ce3e76c1","year":2017},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.737006Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:343bb8a969057e20d61f9aa0517f961002c4ff4a7d4538e015959f9d097b4572","observation_id":"bb1fa786-6272-40f2-8ba2-23a4e27b8b15","resolution":{"observed_at":"2026-08-15T20:18:54.365097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-16T13:38:25.179414Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-15T20:18:52.797005Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.797005Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:e8af01dcf404a1d09fabb5caefc5fa2c9b03df4ad93cd81f3db35fdee1b23c83","observation_id":"2c1be96e-0b4a-4d08-ac31-3363eb4e34f0","resolution":{"observed_at":"2026-08-15T20:18:52.797005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-15T20:18:52.824535Z","title":"InternVideo : General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.824535Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:d4a2082d6cb1aed0dc66d5aa11e61a059b85b4936d3ade4534a36feaf8143b98","observation_id":"9d6faa57-5ac2-4c06-9732-2142efba93d2","resolution":{"observed_at":"2026-08-15T20:18:52.824535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.248099Z","title":"Language models with image descriptors are strong few-shot video-language learners","venue":null,"work_id":"4844d123-7363-4ce5-abe0-ad69720af0b3","year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.829436Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:f9a8966417743a963f77e3f006b050de64e6283ac0b25d806a963203ccbae17d","observation_id":"d3c51b07-1823-4f27-bf79-d91550cafb26","resolution":{"observed_at":"2026-08-15T20:18:54.251351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.235123Z","title":"STC : A simple to complex framework for weakly-supervised semantic segmentation","venue":null,"work_id":"3b866000-7cf5-4850-b963-c4b84518fbc6","year":2016},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.833774Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:13ec2708d1cca8c15598c14dce5de9f986690e4c9ea5178ea6d044c7d909f994","observation_id":"024758c1-057c-4296-af9d-9cd960e4c43e","resolution":{"observed_at":"2026-08-15T20:18:54.240302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.098151Z","title":"B., and Gan, C","venue":null,"work_id":"89d25fc9-c27b-43a1-afb9-e8960dfbd805","year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.838175Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:03c075a0454af1784ad6de861f64d2fe800ecf869c86efa4c772c70b8d5cd1ac","observation_id":"5a5aa68f-7ab6-46df-96c9-f8cad68acceb","resolution":{"observed_at":"2026-08-15T20:18:54.170867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.088392Z","title":null,"venue":null,"work_id":"de0952d6-1af0-4d64-9cdb-faafc4911a8a","year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.842464Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:84dd3524e101812be5d012182b80cde3ec15f15dfb31c6f886ecd3a4d992942f","observation_id":"6c4c1dfd-2fd1-44bd-bff1-c6f74c7d7b0d","resolution":{"observed_at":"2026-08-15T20:18:54.091843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:54.077584Z","title":"Next-QA : Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"e04120d1-3524-4852-a28a-6c3acf2b60f0","year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.875308Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:32d320823cfe8e84ad1d27653415cd35b0fd62741f5f027114262d7b62a84c15","observation_id":"e52093e4-2b9e-4fb0-ad5c-b5dd892ec27d","resolution":{"observed_at":"2026-08-15T20:18:54.081918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00402","last_updated":"2023-02-01T12:40:03Z","snapshot_observed_at":"2026-08-16T15:58:32.472115Z","submitted_at":"2023-02-01T12:40:03Z","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00402","snapshot_observed_at":"2026-08-15T20:18:52.964977Z","title":"mPLUG-2 : A modularized multi-modal foundation model across text, image and video","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.964977Z"},"links":{"cited_paper":"/paper/2302.00402","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:7ca941d6d865a2293ad59657c86a48e884a69df8e1e6122bc0356c2ffdc37487","observation_id":"cdf6bca2-8547-46d6-9c05-8ee636428641","resolution":{"observed_at":"2026-08-15T20:18:52.964977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.937940Z","title":"W., Salakhutdinov, R., and Manning, C","venue":null,"work_id":"b6afa045-25b5-480c-b572-e7c153acb935","year":2018},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.969649Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:629fa515533d8f134a18add99c9ccf5e2873249231db58f8f567028ed2fd9fc2","observation_id":"0303ce46-2eb6-4197-9eed-bb9a81059ffd","resolution":{"observed_at":"2026-08-15T20:18:54.002089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.927557Z","title":"Neural-symbolic VQA : Disentangling reasoning from vision and language understanding","venue":null,"work_id":"d05598f6-e7c4-4807-a93a-98ee03f90df8","year":2018},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.972655Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:cdf2efb6a292c271175159ed6d94882d27b3fbb08a82ffabe2ed2b5fe8d5229b","observation_id":"7a2ab9c0-d6f5-4a9e-83a0-62150c5bf623","resolution":{"observed_at":"2026-08-15T20:18:53.931880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.865820Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"52ab7b7a-ba32-42a4-8dc6-18f32a91637e","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.977650Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:809e1462e1a938812f383be95cbe8c80028706d1dcf96315b9669e8b18d975c6","observation_id":"40c08bc2-3a66-42bc-b321-6d9ddfb3a8a1","resolution":{"observed_at":"2026-08-15T20:18:53.920673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.737102Z","title":"ANetQA : A large-scale benchmark for fine-grained compositional reasoning over untrimmed videos","venue":null,"work_id":"6ba542d1-bac7-473b-b957-b7856f67ee67","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.982250Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:144786afedc639b104f5bba6a3e5673f44a48255d10c606d3efb098c052e1580","observation_id":"1b879339-726b-4b7f-8ee6-5397d7ae8b1b","resolution":{"observed_at":"2026-08-15T20:18:53.740461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.724064Z","title":"S., Cao, J., Farhadi, A., and Choi, Y","venue":null,"work_id":"7b9aaf12-7271-423e-8b54-653f2c72dbc4","year":2021},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:52.987034Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:45103943869b2db3ae58e96fb66bd8c29e6f6f045d0bb1a75ba5734bb69d99ff","observation_id":"662ab958-dd81-444f-abc3-bf481bfcf122","resolution":{"observed_at":"2026-08-15T20:18:53.728692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.564891Z","title":"Socratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":"76bbaa25-1ba3-4926-8e69-621fdce2bc0f","year":2023},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:53.039709Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:4f454927c3e7c2902fd452f937e80a961cb432222b39016865c896c959bf3678","observation_id":"4902b6f6-d0f6-4c1f-8293-e79c098a773d","resolution":{"observed_at":"2026-08-15T20:18:53.662002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-15T20:18:53.128703Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:53.128703Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:3eba874c5443f6c07363bad957fd46018d7577a6bcd7dd7ac7c3bd1ba97b047c","observation_id":"a80565bb-cabc-40ef-b32b-3474db711920","resolution":{"observed_at":"2026-08-15T20:18:53.128703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.489002Z","title":"Where does it exist: Spatio-temporal video grounding for multi-form sentences","venue":null,"work_id":"6234b12e-a0c4-43eb-b47f-d5a8d3e9cf4a","year":2020},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:53.132142Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:af64f5e0e10f05bebd121d07ac7ca7b9ca874b347386b2b3547a01545c68e514","observation_id":"3f09dded-6a1b-4309-98b5-1a3fe53b8741","resolution":{"observed_at":"2026-08-15T20:18:53.493343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.475325Z","title":"Video question answering: Datasets, algorithms and challenges","venue":null,"work_id":"6b62e83f-c61d-4b91-80a2-b377955b0af1","year":2022},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:53.135905Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:31f5b2707aeb16fda540183b3940dbc9232e1171007f01476214c92571dcb817","observation_id":"cd2bf090-c967-4181-93b4-2b902cba8d16","resolution":{"observed_at":"2026-08-15T20:18:53.481138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.373240Z","title":"J., and Rohrbach, M","venue":null,"work_id":"3b4235d5-a14d-4100-bde2-299d0d92f203","year":2019},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:53.139787Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:0c2ca2fbadd37f30bd1571aa5a62a191697dd20026579fbc91dddd9264985810","observation_id":"ed530913-ea58-4888-b9e1-a821b2d8c0ef","resolution":{"observed_at":"2026-08-15T20:18:53.467634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:53.271217Z","title":null,"venue":null,"work_id":"b991fea5-6521-4401-a1f9-f7e0aab63a65","year":1970},"citing_paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:53.143452Z"},"links":{"citing_paper":"/paper/2505.13429"},"observation_digest":"sha256:b0f4560bc428f10ad0c5aaaf712f57c5f5696d680fad29e40094625bf5c9b290","observation_id":"5c21cffe-8e23-465d-901e-3412ac9b505c","resolution":{"observed_at":"2026-08-15T20:18:53.276370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13429","last_updated":"2025-05-19T17:55:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T20:11:28.665261Z","submitted_at":"2025-05-19T17:55:14Z","title":"Understanding Complexity in VideoQA via Visual Program Generation"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 2 inbound Pith citation observations for arXiv:2505.13429."}