{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06e7a6bcb1d719161220ae0cd715cb684400fefdfcaf16a217979b5eb6b37f92","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:41:13.655335Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:01:48.251493Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T18:33:50.200070Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13405","snapshot_observed_at":"2026-08-03T04:01:48.251493Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06223","last_updated":"2026-07-08T21:07:11Z","snapshot_observed_at":"2026-08-07T09:15:51.441564Z","submitted_at":"2026-02-05T22:01:50Z","title":"Scaling Mobile Chaos Testing with AI-Driven Test Execution","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:01:48.251493Z"},"links":{"cited_paper":"/paper/2507.13405","citing_paper":"/paper/2602.06223"},"observation_digest":"sha256:bbc332f4e445dded647c38f6f56437dbae79a577f560ca5dba7b329b8daf85d8","observation_id":"4340bbb5-e9ee-4e65-a263-2a16a363cfbe","resolution":{"observed_at":"2026-08-03T04:01:48.251493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2507.13405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13405","snapshot_observed_at":"2026-06-29T18:33:50.200070Z","title":"Alexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary, Guillaume Wenzek, Francisco Guzmán, Edouard Grave, Myle Ott, Luke Zettle- moyer, and Veselin Stoyanov","venue":null,"work_id":"dcd3d1bf-4b59-4487-b738-e6e6a3e7c198","year":null},"citing_paper":{"arxiv_id":"2605.26601","last_updated":"2026-05-26T06:36:27Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T06:36:27Z","title":"FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:32:41.348880Z"},"links":{"cited_paper":"/paper/2507.13405","citing_paper":"/paper/2605.26601"},"observation_digest":"sha256:997acbfc16df58c8f7218e261023c6f912d46c49f239f8347529dc462ca43271","observation_id":"b651095a-580d-412d-a407-a5cb8419b22e","resolution":{"observed_at":"2026-06-29T18:33:50.201757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13405/citation-record","integrity":"/paper/2507.13405/integrity","json":"/paper/2507.13405/citation-record.json","paper":"/paper/2507.13405"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:41:12.166689Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.166689Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:d8834bff82ea6ac783f99e24342f757527267fb0c00d8e91f85ebac52e042afb","observation_id":"9ecf877d-c8c4-4b1a-8c1f-99a4d8bd3e9c","resolution":{"observed_at":"2026-08-06T16:41:12.166689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T16:41:12.409602Z","title":"Janus-pro: Unified multimodal understand- ing and generation with data and model scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.409602Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:a60ee52845a4f4bcb51595d98f62fd70214fbc4378d1efeea4f926fb04d51289","observation_id":"39f49f9f-7fe3-4f23-afa7-7c5ebae49050","resolution":{"observed_at":"2026-08-06T16:41:12.409602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14669","last_updated":"2025-06-10T09:47:04Z","snapshot_observed_at":"2026-07-06T19:36:05.879892Z","submitted_at":"2024-10-18T17:58:21Z","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14669","snapshot_observed_at":"2026-08-06T16:41:12.639417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.639417Z"},"links":{"cited_paper":"/paper/2410.14669","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:2e1b2880b9d95142ca5d2daa8fc5e4001636d582129450a4056f8fa3997c04a3","observation_id":"284bbb27-812a-4401-b4af-d444e8cf7cde","resolution":{"observed_at":"2026-08-06T16:41:12.639417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-06T16:41:12.716870Z","title":"Bench- mark evaluations, applications, and challenges of large vision language models: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.716870Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:2ab9ef00dc6706b24f8a80e8482b309bbe9388f3ca2cb8d646c7d58949a5ec0a","observation_id":"bad059c7-b2ee-4e1c-ab95-768d91d5a10d","resolution":{"observed_at":"2026-08-06T16:41:12.716870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:14.713128Z","title":null,"venue":null,"work_id":"7927b98d-8ce4-47d7-8007-1e4f16975f1e","year":2024},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.809200Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:6e9c7071c6eefc256656d9e92ab6c8f9a0928ac0fcc1a5700a287ccc46f5adb1","observation_id":"1720286c-ee3f-4044-bbb9-3943b9585fb8","resolution":{"observed_at":"2026-08-06T16:41:14.859133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10380","last_updated":"2025-04-01T17:25:53Z","snapshot_observed_at":"2026-08-07T09:15:42.716142Z","submitted_at":"2024-07-15T01:21:56Z","title":"NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models","version":3},"cited_work":{"arxiv_id":"2407.10380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10380","snapshot_observed_at":"2026-08-06T16:41:14.084744Z","title":"NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models","venue":"cs.CV","work_id":"eb0bc349-ab0a-4f68-b0b8-6e2931a6d45d","year":2024},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.884118Z"},"links":{"cited_paper":"/paper/2407.10380","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:0a259ef46f6281991f9ba54d558711870a0f715f3f910d6292c7691718673e00","observation_id":"66eaf9cf-7123-4b91-bd8d-f881b07038ea","resolution":{"observed_at":"2026-08-06T16:41:14.160149Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07566","last_updated":"2022-03-14T15:08:08Z","snapshot_observed_at":"2026-08-05T18:36:34.772896Z","submitted_at":"2021-12-14T17:15:04Z","title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07566","snapshot_observed_at":"2026-08-06T16:41:13.007547Z","title":"Valse: A task-independent bench- mark for vision and language models centered on lin- guistic phenomena","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.007547Z"},"links":{"cited_paper":"/paper/2112.07566","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:61b925f59b014fad5841aa10fb126ae87e045d7508f262baa68b6c7244bb8557","observation_id":"aeac34aa-ad93-4f30-a0da-a40b4b5066b8","resolution":{"observed_at":"2026-08-06T16:41:13.007547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00123","last_updated":"2018-04-30T22:49:54Z","snapshot_observed_at":"2026-07-06T06:36:33.930118Z","submitted_at":"2018-04-30T22:49:54Z","title":"CrowdHuman: A Benchmark for Detecting Human in a Crowd","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00123","snapshot_observed_at":"2026-08-06T16:41:13.138030Z","title":"Crowdhuman: A benchmark for detecting human in a crowd","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.138030Z"},"links":{"cited_paper":"/paper/1805.00123","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:573ab8e12b0e77e2cba8c8a5089090ffa104fbb16358bc55fe22f66eacd25c7b","observation_id":"13202050-d695-432d-b7a4-79bdccf119ae","resolution":{"observed_at":"2026-08-06T16:41:13.138030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-07-06T07:27:52.425939Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-06T16:41:13.278562Z","title":"Nwpu-crowd: A large-scale benchmark for crowd counting and localiza- tion","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.278562Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:460ba75d276e9d16f4297bda53f24be3a138b647e5bb726c8eee31e45f5e0216","observation_id":"f3215973-2793-40bc-82db-132191999531","resolution":{"observed_at":"2026-08-06T16:41:13.278562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-06T16:41:13.357316Z","title":"Mmt- bench: A comprehensive multimodal benchmark for eval- uating large vision-language models towards multitask agi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.357316Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:09cb1ab61705ba8b40fa1cf794fec07ccc2a3281a977efdda4351880f316e435","observation_id":"49b1b18b-a872-47ff-8655-2e2f8a63c8c1","resolution":{"observed_at":"2026-08-06T16:41:13.357316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T16:41:13.436572Z","title":"Mm-vet: Evaluating large multi- modal models for integrated capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.436572Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:cc416ca5a702f449ad89b403a4593422cb0af917a9e3e1edfea4497c4ab7cbba","observation_id":"3cb4cf62-8367-4010-a1de-5c6103ea2db4","resolution":{"observed_at":"2026-08-06T16:41:13.436572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T16:41:13.513227Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.513227Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:1a5a12763acd023efb068f1df33266e5b96b78467576f1fa88b0dfe03da32cdb","observation_id":"f0c63bf0-9da3-404b-a112-d41aa3f3a32e","resolution":{"observed_at":"2026-08-06T16:41:13.513227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:14.552555Z","title":"When in doubt, use more conserva- tive qualifiers","venue":null,"work_id":"006d995b-67ec-40c7-ab9f-b8abb9267759","year":2024},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.590449Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:0dd6ea1013fca5deb892d63caa692b6f1be4892592880722a9c16c7ee02caf13","observation_id":"09201af8-cbf8-45e1-bfca-4b3e0b1d79d0","resolution":{"observed_at":"2026-08-06T16:41:14.620596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:14.392599Z","title":"COREVQA requires models to perform multi-step verification by decomposing complex claims and meticu- lously verifying each component against visual evidence","venue":null,"work_id":"88527e56-b528-4d62-8eef-8a4fdb9b1c02","year":2019},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.655335Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:6dc6d5d7f12a344ec2c79b0ede5c2123bf0fde3a40a7b88a151652b2dbe22de9","observation_id":"28ff9e58-16a6-4a6a-beb9-2db731eed007","resolution":{"observed_at":"2026-08-06T16:41:14.459868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12483","last_updated":"2024-06-07T23:11:14Z","snapshot_observed_at":"2026-07-06T17:32:28.211114Z","submitted_at":"2024-02-19T19:38:58Z","title":"Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12483","snapshot_observed_at":"2026-08-06T16:41:12.234673Z","title":"Ar- tifacts or abduction: How do llms answer multiple- choice questions without the question? arXiv preprint arXiv:2402.12483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.234673Z"},"links":{"cited_paper":"/paper/2402.12483","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:4c6982730e7180e6a0b81b6e100a7e9310370ca9975db20526f583d4ddf5b3ba","observation_id":"94ee7c5c-6f97-4031-9c8b-b618516ea93f","resolution":{"observed_at":"2026-08-06T16:41:12.234673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05343","last_updated":"2024-06-14T08:35:06Z","snapshot_observed_at":"2026-07-06T18:27:28.886692Z","submitted_at":"2024-06-08T04:07:09Z","title":"M3GIA: A Cognition Inspired Multilingual and Multimodal General Intelligence Ability Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05343","snapshot_observed_at":"2026-08-06T16:41:13.203791Z","title":"M3gia: A cognition inspired multilingual and multimodal general intelligence ability benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.203791Z"},"links":{"cited_paper":"/paper/2406.05343","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:92c4da66b9f2781b9688c266bc55e08e12f86a960c067d3e368dec0df7789a45","observation_id":"01a7d63e-f7dd-4c42-8484-267f692b0260","resolution":{"observed_at":"2026-08-06T16:41:13.203791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.11361","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:13.918486Z","title":"R., Bashir, S","venue":null,"work_id":"be7e7864-cae4-48b2-91db-d870dc685c7d","year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.076746Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:bc0b76071b7070d66238590f16628b1be7ab287546b9662c7c108022d36b82af","observation_id":"8c717dd3-edca-4384-b167-0a529f19c289","resolution":{"observed_at":"2026-08-06T16:41:13.982818Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T16:41:12.553911Z","title":"Seed-bench: Benchmarking multimodal llms with gener- ative comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.553911Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:12daf57477674e744ad76aee43275d557d4b263e44bb0ada7c815d1d2ba94f8b","observation_id":"3d466147-a3f3-4582-81cc-cf2bfb5d755d","resolution":{"observed_at":"2026-08-06T16:41:12.553911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T16:41:12.321982Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.321982Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:bc23749b8be3c339a863ab281664be6cbea65f7a1ad10db2a6d50529cabda04c","observation_id":"97e4749f-3741-47c9-840e-643562c7864e","resolution":{"observed_at":"2026-08-06T16:41:12.321982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-06T16:41:12.474596Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.474596Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:a0d2178fe7e0697a932f520191254efdbed9c8411fa825d8eecb840b1963a0ab","observation_id":"b305033a-7bc9-47a0-86da-c716cee83a57","resolution":{"observed_at":"2026-08-06T16:41:12.474596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:36:23.535763Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 2 inbound Pith citation observations for arXiv:2507.13405."}