{"as_of":"2026-08-04T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a88f56fb1b3f7eada50eccdfbca85f6f4d06319bc40ca91f8d5f87af33d302e0","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:05:46.467102Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.11177/citation-record","integrity":"/paper/2604.11177/integrity","json":"/paper/2604.11177/citation-record.json","paper":"/paper/2604.11177"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ActivityNet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"dcfe18eb-74ae-42cf-b055-cec79f185e78","year":2015},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:78b72060b2052919c7a7cd54674ecc68ada1a7338b5e709809d9754efe6b96bc","observation_id":"184a4c4a-f035-4b59-a0fb-ea6f0f766382","resolution":{"observed_at":"2026-05-17T17:01:59.495645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:1993bb6bdf3f5130bfefdb482e39ea574373594dfcdb2012296dd3f9194fccf9","observation_id":"9ea846ef-fd0b-49df-bc55-3f3136ae3b8d","resolution":{"observed_at":"2026-05-11T09:21:00.049963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:91bb280f80da38303c28e41a529a9afd52c72f1443c89ebb3820644972d16507","observation_id":"12623f48-c162-468b-ae0e-d22fd43ce55c","resolution":{"observed_at":"2026-05-11T09:21:00.028188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:a8a2d976ffc580e60bd1ab2750ff0eeea8c210914b1b52785ee41be636b30a45","observation_id":"d6180581-857c-4979-9ce9-996ea3826343","resolution":{"observed_at":"2026-05-11T09:21:00.044696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"7b7f73fc-921f-4127-b895-8d6802f3def3","year":2022},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:a7ed4b0b285b7270b3074c4ebcd0dac25604c9cdae48fc450493717aba8c84b1","observation_id":"74f86ccc-4312-489a-bd07-8b948d636de4","resolution":{"observed_at":"2026-05-17T17:01:59.482617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"8317bf37-fbf4-4d5b-8fdb-9f98b8d8a927","year":2021},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:8e5be7b3e6b5626f1ffd9e732b61753630c3b5f8c72e2c3e6ad228dea3f8656b","observation_id":"0c654cf5-93d0-49ec-b169-92825527aa05","resolution":{"observed_at":"2026-05-17T17:01:59.478851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:4b9bf999dbb4ea13ffa4d9b4a840ab8d83be25c03cdd91151dc08e986e14d0a9","observation_id":"ed5db929-2208-4d51-a68c-dbe79ed601de","resolution":{"observed_at":"2026-05-11T09:21:00.031299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:1e226a421b70db240a9e8a26288e688d4f0ced0371ebdaa5b258a4487d9450bd","observation_id":"e8f66c76-3cf0-4b62-9add-3b97e0757e59","resolution":{"observed_at":"2026-05-11T09:21:00.037094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"2e61d915-83cc-46c3-98c0-2f1cad3e8c2c","year":2022},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:06516cba3adb824512057c605bb6cb6b60b543ba36dfdb6c7593461921f812c8","observation_id":"fc4373d3-ec42-4a9d-a61b-3e2a3b9914f1","resolution":{"observed_at":"2026-05-17T17:01:59.486427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HellaSwag: Can a ma- chine really finish your sentence? InProceedings of the 57th Annual Meeting of the Association for Computational Linguistics (ACL), pages 4791–4800","venue":null,"work_id":"2b4c5837-824a-4ac8-ae9b-538fc3d7f0b4","year":2019},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:3d6a0960ca8e5e1a4fe0200e4b67925270e0afc0b3d06fa0373c87559389807e","observation_id":"09e4eda8-0908-4689-abce-7ec6be1ce3c9","resolution":{"observed_at":"2026-05-17T17:01:59.490380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, et al","venue":null,"work_id":"9c21c49d-9daf-4656-8106-2583030052b0","year":2023},"citing_paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:46.467102Z"},"links":{"citing_paper":"/paper/2604.11177"},"observation_digest":"sha256:90ec0eb8b31adda51c7d20b4def63343ebe319ca025962ca808309b5459e45d3","observation_id":"8b66a822-f6ee-4374-a7b9-590412a570e5","resolution":{"observed_at":"2026-05-17T17:01:59.474637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.11177","last_updated":"2026-04-13T08:40:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:40:10Z","title":"Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":6},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2604.11177."}