{"as_of":"2026-08-10T17:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df2ee5a2ab31267eeba157e1b94fa22127d6ffc2766c96321c45379a33006671","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:26:35.957183Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T07:31:13.950276Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-10T17:26:35.957183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T17:21:43.276747Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":247,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.957183Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:90263c6ff828c6c79c393e9a2bbe803d87402eae9106a2a38f9cf81b9f0491e3","observation_id":"eb2297da-7066-4777-b5ff-46b0a8b2543e","resolution":{"observed_at":"2026-08-10T17:26:35.957183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-07T14:05:37.515954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-10T11:50:13.419030Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.515954Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3c98d4dba950f520cab4554d99806f3ccc347776c5e942a2959f3f1ddad80c5e","observation_id":"04b7d7ec-d4f9-402a-ae47-7cdbe860d0e6","resolution":{"observed_at":"2026-08-07T14:05:37.515954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-07T05:41:39.695176Z","title":"Revisiting the role of lan- guage priors in vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07371","last_updated":"2025-06-10T13:33:53Z","snapshot_observed_at":"2026-08-08T15:59:53.622703Z","submitted_at":"2025-06-09T02:42:13Z","title":"ARGUS: Hallucination and Omission Evaluation in Video-LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:39.695176Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2506.07371"},"observation_digest":"sha256:826cc11f335edbcc8a08425495d43e6f892c00496a153bed2a3d8b51646e52a0","observation_id":"ecbdd126-2c17-4950-8c3c-f65d8f2cea17","resolution":{"observed_at":"2026-08-07T05:41:39.695176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-06T12:08:01.756106Z","title":"Revisiting the role of language priors in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22100","last_updated":"2025-07-29T17:59:16Z","snapshot_observed_at":"2026-08-09T12:56:56.544287Z","submitted_at":"2025-07-29T17:59:16Z","title":"Trade-offs in Image Generation: How Do Different Dimensions Interact?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:01.756106Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2507.22100"},"observation_digest":"sha256:3e53a33e5320a8d0bd671d789ca6590773a979f22bf31da369a4f58e7a75a84d","observation_id":"3cea00c3-9b4f-4d96-9dd4-cab80c24a988","resolution":{"observed_at":"2026-08-06T12:08:01.756106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-04T13:52:15.074817Z","title":"Revisiting the role of language priors in vision-language models.arXiv preprint arXiv:2306.01879,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24566","last_updated":"2026-07-16T09:55:58Z","snapshot_observed_at":"2026-08-08T03:11:39.857299Z","submitted_at":"2025-09-29T10:19:22Z","title":"TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T13:52:15.074817Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2509.24566"},"observation_digest":"sha256:8f40a39330be62f617430cad51d738f03dd543b263b623df05e1eaa2fa9978fc","observation_id":"da03bf5f-cf85-4386-a535-6bc73e606300","resolution":{"observed_at":"2026-08-04T13:52:15.074817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2306.01879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.01879 , year =","venue":null,"work_id":"f0169c48-9cfc-469a-b88f-5d8912aec5f4","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:982ab2aec766a114ff529d9eecf1552218c2db0abdf33a0bd67a185c34c069e1","observation_id":"ed0e9454-7441-4148-89dd-c43c9464f95d","resolution":{"observed_at":"2026-05-11T13:46:04.507451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2306.01879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.01879 , year =","venue":null,"work_id":"f0169c48-9cfc-469a-b88f-5d8912aec5f4","year":null},"citing_paper":{"arxiv_id":"2605.21919","last_updated":"2026-05-21T02:44:54Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:44:54Z","title":"SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-22T07:29:49.950084Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2605.21919"},"observation_digest":"sha256:c16b2baab4dfb78a059d4f047dc5bc5598ddb17ac88a36d2f4b663f2aebd7f5e","observation_id":"27270a0a-9306-4d62-a338-67bc4726689e","resolution":{"observed_at":"2026-05-22T07:31:13.953141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-07-12T06:36:12.761601Z","title":"arXiv preprint arXiv:2306.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02853","last_updated":"2026-07-03T01:29:30Z","snapshot_observed_at":"2026-08-06T09:11:41.243943Z","submitted_at":"2026-07-03T01:29:30Z","title":"Prior Bias in Vision Language Models on UML Diagram Interpretation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-12T06:36:12.761601Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2607.02853"},"observation_digest":"sha256:aa87fc971623319122a59936993e8ad5e39509c16cdcd3db6c76cb368d986e87","observation_id":"db7c25f4-b9aa-461a-8b8f-5d7f5e3f644f","resolution":{"observed_at":"2026-07-12T06:36:12.761601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-02T07:33:08.314581Z","title":"Revisiting the role of language priors in vision-language models.arXiv preprint arXiv:2306.01879, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-09T13:48:47.859181Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.314581Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:5482997c803e7f44d994220ff6ecb4c654f0b5ed86b43f7c6b464aebbc725c39","observation_id":"d20ccc5c-43f6-487e-aaf1-5b1d8fa8e22a","resolution":{"observed_at":"2026-08-02T07:33:08.314581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-06T18:44:46.262146Z","title":"arXiv preprint arXiv:2306.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04698","last_updated":"2026-08-05T11:07:22Z","snapshot_observed_at":"2026-08-08T23:12:18.742707Z","submitted_at":"2026-08-05T11:07:22Z","title":"Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:44:46.262146Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2608.04698"},"observation_digest":"sha256:15262ea6bae9204019aeba26f052a0f8e31cfeeb72e7367578397272bafa9120","observation_id":"02261088-172b-430b-bb3d-1085ad446991","resolution":{"observed_at":"2026-08-06T18:44:46.262146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.01879/citation-record","integrity":"/paper/2306.01879/integrity","json":"/paper/2306.01879/citation-record.json","paper":"/paper/2306.01879"},"outbound":[],"paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2306.01879."}