{"as_of":"2026-08-08T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02990bab158b1724a2035f022a6b71017f2ca0e6546f409d4059a77cbf36721c","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:19:20.572832Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13820/citation-record","integrity":"/paper/2507.13820/integrity","json":"/paper/2507.13820/citation-record.json","paper":"/paper/2507.13820"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:19.594085Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.594085Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:a507cbd49fe46f0f1a8a761a5a5719ed275f17cc9631881e5dea116e36f4be04","observation_id":"7942b469-8135-4613-b723-615543de5f56","resolution":{"observed_at":"2026-08-06T16:19:19.594085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:21.018342Z","title":"Gemini 2.5 Pro Preview (2025-03-25) , 2025","venue":null,"work_id":"00938c48-5087-42da-ae6e-a803b300d360","year":2025},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.680262Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:43c2bdc6d58f591f01e990c79b0a57c1645953a622678fdb19ec0bbc08388c29","observation_id":"a26eab60-698e-4f3f-a062-4c57e6fe0641","resolution":{"observed_at":"2026-08-06T16:19:21.159092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03690","last_updated":"2024-05-08T19:46:35Z","snapshot_observed_at":"2026-07-06T18:10:33.673157Z","submitted_at":"2024-05-06T17:59:45Z","title":"How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03690","snapshot_observed_at":"2026-08-06T16:19:19.770396Z","title":"How good is my video lmm? complex video reasoning and robustness evaluation suite for video-lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.770396Z"},"links":{"cited_paper":"/paper/2405.03690","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:f207aa95184ac68b8c0a83fe0bf5f0eb82b8694eaca3abdf5e4836c46013ee69","observation_id":"51d3faf4-ad0f-42bd-afbe-a5773eadb2e6","resolution":{"observed_at":"2026-08-06T16:19:19.770396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:20.768800Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"f8def62b-b2c3-475b-91ad-491025511803","year":2024},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.916856Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:051e2ae7a932873eaca2117e77be242b6c3acbc3a5411c6ad7d3782b4bc189f9","observation_id":"fb465385-0d6d-433f-ad89-d4a14ff65ae1","resolution":{"observed_at":"2026-08-06T16:19:20.890382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T16:19:20.053425Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.053425Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:c5ae470d7e8b1125f23a239563124557f219c424f400f081489bc12ecb2cc7a4","observation_id":"c4b533c1-c4c3-466b-99f3-ac902afaac00","resolution":{"observed_at":"2026-08-06T16:19:20.053425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T16:19:20.204460Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.204460Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:634dfa808305973674ada85f4012383479a73ae0fd99af9bcc82c44a17762539","observation_id":"7c45b3d7-ddaa-431b-adf1-0af8a14fca00","resolution":{"observed_at":"2026-08-06T16:19:20.204460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T16:19:20.329167Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.329167Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:b78684ad06ce986a20f41afd3b82c1c9862ebea6a6b1ce166ccf564b3970a408","observation_id":"3f310098-559d-497b-aa17-2aa12af0fde3","resolution":{"observed_at":"2026-08-06T16:19:20.329167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:20.430057Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.430057Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:e6892fbbc0d48045b708ccb56e9c78e0ce2b541755822de2c75c358ea6259c29","observation_id":"df85bc52-675d-40b2-9061-7dfa2486f749","resolution":{"observed_at":"2026-08-06T16:19:20.430057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T16:19:20.572832Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.572832Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:01645a4a2ab02f0daf9d02dfd9a8fde195d9d25e006bc017f17f7e25df4298ac","observation_id":"1b7c2315-9f7b-48f5-9ee5-19ff8e9f5dee","resolution":{"observed_at":"2026-08-06T16:19:20.572832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:13:35.175108Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 0 inbound Pith citation observations for arXiv:2507.13820."}