{"as_of":"2026-08-09T06:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8afb93b4a8cb63e1ce514bad85567d6eba20910488cc2bd87414ebc1893f0581","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:03:13.329200Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09573/citation-record","integrity":"/paper/2502.09573/integrity","json":"/paper/2502.09573/citation-record.json","paper":"/paper/2502.09573"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T21:03:13.196965Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.196965Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:21212178d4860e01d9b349fdd31f444aed9777b254b1432f41d7abf823f37d72","observation_id":"de2ca75f-24bb-4753-b803-a9624a78f9df","resolution":{"observed_at":"2026-08-07T21:03:13.196965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.203362Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.203362Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:54a897899b061a584506366630c219adfe5361d782740c51ef8b29730beefc56","observation_id":"1624cbe1-9f77-4ade-bdfd-9f68932708a3","resolution":{"observed_at":"2026-08-07T21:03:13.203362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T21:03:13.209644Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.209644Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:98ce843d9e98b75bdeac805b34c416dbde825831e0ae05ef549f2193e40a0eea","observation_id":"8ddb77f4-17e0-45ba-b278-4f49f0224a65","resolution":{"observed_at":"2026-08-07T21:03:13.209644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T21:03:13.216250Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.216250Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:52210597e5929db5e018485a9a7a3d89d91c1c1a3ed23f386a175f3b60610213","observation_id":"b3f95510-baa5-443b-9ed1-d0c4c216c43a","resolution":{"observed_at":"2026-08-07T21:03:13.216250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03974","last_updated":"2019-11-10T18:26:24Z","snapshot_observed_at":"2026-08-04T14:34:41.831629Z","submitted_at":"2019-11-10T18:26:24Z","title":"A Multimodal CNN-based Tool to Censure Inappropriate Video Scenes","version":1},"cited_work":{"arxiv_id":"1911.03974","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.03974","snapshot_observed_at":"2026-08-07T21:03:17.663493Z","title":"A Multimodal CNN-based Tool to Censure Inappropriate Video Scenes","venue":"cs.MM","work_id":"a2b78c1e-270a-4815-a45b-93e13d1c03d3","year":2019},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.222137Z"},"links":{"cited_paper":"/paper/1911.03974","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:d234e65fd839926b3ad63b654d6d141e7b15b8afad953eb5c2e5395906b5150f","observation_id":"67d1ec17-df35-401b-844b-1cc8ae526129","resolution":{"observed_at":"2026-08-07T21:03:17.669138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T21:03:13.228207Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.228207Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:de8eda70548656f5dd2ea9e4f3e476cd3ee32f0036db95fcca2c52b60cf42d01","observation_id":"17e20f24-31b8-4b5c-8da7-44d4284838d7","resolution":{"observed_at":"2026-08-07T21:03:13.228207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T21:03:13.234882Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.234882Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:a77511fc3046456c33cfd2c3658fb3be177fc2ca0d49eae9712f664842bde3c5","observation_id":"db718e0c-6c29-4e3f-9505-7265c13a891c","resolution":{"observed_at":"2026-08-07T21:03:13.234882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.241015Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.241015Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:dac7fcd69be33667f8f7146c0fd4d4e9f85398ee66aa96839478878b8c16772f","observation_id":"789aac87-32e9-4c96-934a-497f7fa53db5","resolution":{"observed_at":"2026-08-07T21:03:13.241015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.246481Z","title":"H., Zhang, P., Zhang, H., Yang, J., Li, C., Zhong, Y., Wang, L., Yuan, L., Zhang, L., Hwang, J.-N., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.246481Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:7a53e00d12e96b8eee4d00a6a35afb0aedb3baf4cb1e1349a390e6a9dd338425","observation_id":"090a0efb-7a03-4b0e-89fe-23ca011b8ccd","resolution":{"observed_at":"2026-08-07T21:03:13.246481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.251781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.251781Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:186de691ccc43c88ce98996634decf8920378b7a7e6fc5d34de240e672b1341e","observation_id":"face6fb8-7606-4124-98d4-77ae618e30fa","resolution":{"observed_at":"2026-08-07T21:03:13.251781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T21:03:13.257128Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.257128Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:c7ad1684e63eb26438758c09ded5d69df6219899131b75d6193efb0b349fee14","observation_id":"a0bc587c-2b28-4d79-ad1a-0651955a31b0","resolution":{"observed_at":"2026-08-07T21:03:13.257128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.865405Z","title":"Openai official api documentation, 2025","venue":null,"work_id":"af6ad5f0-e10c-48a2-9506-27d0ed8d67b0","year":2025},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.263148Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:3c0ca28c8a966b1f96e3195c2bfd31b528c775e5da345c1e8c076e75ad6b0037","observation_id":"c85518da-c75f-43c9-ab7e-5cb99c1ad88f","resolution":{"observed_at":"2026-08-07T21:03:17.873073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.823247Z","title":"J., Mahmud, A., Sobuj, M","venue":null,"work_id":"8f5e4dfc-609f-4ce5-96d2-b3c71233bb05","year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.268323Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:8ad865ae3dae798f54f4407d1aac985b9db37c520c693cf8e118a25988f018d7","observation_id":"f802c8c8-efde-455f-a883-d7b3fb7cf566","resolution":{"observed_at":"2026-08-07T21:03:17.852117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.273301Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.273301Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:898808fd8a03a50b67d9e49efdc8c4d057d1649d48d406028c0db72f6268d22a","observation_id":"45ade3e0-9fd1-444f-aeac-847b27b071e8","resolution":{"observed_at":"2026-08-07T21:03:13.273301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.793245Z","title":"Will the \\ 1 trillion of generative ai investment pay off?, 2024","venue":null,"work_id":"bdf9eb1f-9c64-4e2c-b5e1-1846313918f1","year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.278477Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:48db1fd60a7d952246d6bdc33f9f79b756ad91356b856e5679c493bbedfe158a","observation_id":"8c7641b8-503c-4d55-ab5d-42edf16a08e7","resolution":{"observed_at":"2026-08-07T21:03:17.798891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.283982Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.283982Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:c00f88e8a9a152e029ce0e186911448b8344eb022ca161979bef35bf128fa7ed","observation_id":"631c7893-09fa-4324-a0d3-12c3c8e99927","resolution":{"observed_at":"2026-08-07T21:03:13.283982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06985","last_updated":"2024-08-30T06:27:58Z","snapshot_observed_at":"2026-08-07T15:14:33.676018Z","submitted_at":"2024-07-09T15:59:28Z","title":"PEER: Expertizing Domain-Specific Tasks with a Multi-Agent Framework and Tuning Methods","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06985","snapshot_observed_at":"2026-08-07T21:03:13.289380Z","title":"Peer: Expertizing domain-specific tasks with a multi-agent framework and tuning methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.289380Z"},"links":{"cited_paper":"/paper/2407.06985","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:73fd276ed828493c180b08056e674f84d156375eac751f6641cbd64cb1dae225","observation_id":"c6fdfcdf-b3b3-4dc0-9a83-71a1ed37e48a","resolution":{"observed_at":"2026-08-07T21:03:13.289380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05461","last_updated":"2017-07-10T00:44:45Z","snapshot_observed_at":"2026-08-06T13:27:40.644362Z","submitted_at":"2017-06-17T00:39:04Z","title":"Truly Multi-modal YouTube-8M Video Classification with Video, Audio, and Text","version":3},"cited_work":{"arxiv_id":"1706.05461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.05461","snapshot_observed_at":"2026-08-07T21:03:13.402174Z","title":"Truly Multi-modal YouTube-8M Video Classification with Video, Audio, and Text","venue":"cs.CV","work_id":"413a5862-a12d-4722-a6a7-65e8f0f9766f","year":2017},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.295499Z"},"links":{"cited_paper":"/paper/1706.05461","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:a10cdd31b497a0bb52fac71c8952b8b1c6da970e8839ff20a37e72a71702fe0c","observation_id":"be6885a3-3740-4ae4-bd0e-13f3421c0db6","resolution":{"observed_at":"2026-08-07T21:03:13.409766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:17.775018Z","title":"and Nawaz, T","venue":null,"work_id":"6c82be5c-14a9-4d74-9d14-0b8919710cee","year":2022},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.300703Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:9c4dcf7990a0e8c508073c165c051983c16e9e5b0a701cfeabcfcee7f2f29fed","observation_id":"ff8f4093-4c2c-4c11-8553-c46bc9b15223","resolution":{"observed_at":"2026-08-07T21:03:17.780330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15061","last_updated":"2024-12-17T12:45:20Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T02:24:15Z","title":"Fine-tuning Large Language Models for Domain-specific Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15061","snapshot_observed_at":"2026-08-07T21:03:13.306086Z","title":"Fine-tuning large language models for domain-specific machine translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.306086Z"},"links":{"cited_paper":"/paper/2402.15061","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:248b1f2c8fc723d0a12f8110f6f2cdb022ac74519b64b83bee3660d7b5f41de3","observation_id":"43e1c9d8-a0fa-4e48-878b-a258b5620dc3","resolution":{"observed_at":"2026-08-07T21:03:13.306086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.311663Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.311663Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:7fc4b3fd0d89ee4a5239137457f63d6517dcb3fa7984b7f073c3b79e0aaaa028","observation_id":"64a935d5-5239-436a-aaaa-507bab5120fd","resolution":{"observed_at":"2026-08-07T21:03:13.311663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.318053Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.318053Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:ee2a701b81fc9a92ab6eac8abc41bfa062cde0ab5eb4fea67ecb78fedfdd4a37","observation_id":"56d84102-f72a-4a7e-b68f-f0a97fef3345","resolution":{"observed_at":"2026-08-07T21:03:13.318053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:03:13.323649Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.323649Z"},"links":{"citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:54fe44eb18b28b45bc7fa1a9185c751526eaecbbb71651aa33c424bc73173e0c","observation_id":"955c383f-d17d-4541-a83a-83e4be449b2a","resolution":{"observed_at":"2026-08-07T21:03:13.323649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-07T21:03:13.329200Z","title":"world knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T21:03:13.329200Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2502.09573"},"observation_digest":"sha256:39b49bc39adecb9e26ce70362644779338dc918efccd3c1b21019a144975b8d5","observation_id":"2f342397-317a-445a-b690-75ab64be3803","resolution":{"observed_at":"2026-08-07T21:03:13.329200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09573","last_updated":"2025-04-25T22:35:16Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:55:27.791886Z","submitted_at":"2025-02-13T18:31:17Z","title":"Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2502.09573."}