{"as_of":"2026-08-10T10:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fa0b70d935b44dfd3feebdc18b146d5b98fe04884362b9cc65cd216aa68b206","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:03:53.348354Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:33:44.595993Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:33:46.092736Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"cited_work":{"arxiv_id":"2502.00711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00711","snapshot_observed_at":"2026-08-06T14:33:46.092736Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","venue":"cs.CV","work_id":"37a6ec4f-6918-4e6d-a654-d8f9cc80ded7","year":2025},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:44.595993Z"},"links":{"cited_paper":"/paper/2502.00711","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:711598f637394913af0a11a9fa9ec9eba479a320322c9f8aa30d33d49e460396","observation_id":"798e4ab8-facb-4bdd-b162-b30819d9d17f","resolution":{"observed_at":"2026-08-06T14:33:46.154777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00711/citation-record","integrity":"/paper/2502.00711/integrity","json":"/paper/2502.00711/citation-record.json","paper":"/paper/2502.00711"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-09T18:03:53.108911Z","title":"Paligemma 2: A family of versatile vlms for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.108911Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:80a18a36d76e56c08b520ad6be951d75ba1e75789a74ed8954428a8775c91185","observation_id":"649cd177-51ed-4f04-9e08-d8538d083313","resolution":{"observed_at":"2026-08-09T18:03:53.108911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.114192Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.114192Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:35342153f7cee101d69b340de06562e8b22da51470043cc300b8cb3f107b7027","observation_id":"d1e22241-9f19-4b57-a981-2e8df316fd40","resolution":{"observed_at":"2026-08-09T18:03:53.114192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.269501Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding,","venue":null,"work_id":"141b6eb0-dba5-4d77-b768-40bb506b9097","year":2021},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.118804Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:deff0f9947db1e30bdf6326cd8c4466953ad15020256bfd700c5d31617daf568","observation_id":"ddb8f5b2-24eb-467b-9b82-dc9abbc70039","resolution":{"observed_at":"2026-08-09T18:03:54.273883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.254990Z","title":"Omni-smola: Boosting generalist multimodal models with soft mixture of low-rank experts,","venue":null,"work_id":"3eeb3a34-29bf-4d3c-9783-8ca0f42aeb1a","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.123583Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:56826a7e2b3cec47f488b9e6c996f48bb20604f91f03bfae9de727fe207def5b","observation_id":"cad07e75-4fab-4b70-b696-a2df3173f6ad","resolution":{"observed_at":"2026-08-09T18:03:54.259335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.240219Z","title":"Cola: A benchmark for compositional text-to-image retrieval,","venue":null,"work_id":"720707ee-ee94-4f6f-af70-a85b179a89ad","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.128033Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:fedf8fc4f279fb47a4116bf8da133f6ab3f3c6e2f06c87fb6ef82f92f08e62ba","observation_id":"78d15b40-0858-4e91-b723-e66af2381bdf","resolution":{"observed_at":"2026-08-09T18:03:54.244820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.225805Z","title":"Visual programming: Compositional visual reasoning without training,","venue":null,"work_id":"58b72a21-5b98-43f3-9538-0809b6bbc2a3","year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.132829Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:d7d0ad843618e2addf3e4a3ed9fa1da555ff8cf2418d00904c767011e8b40404","observation_id":"fd748ad8-7833-406c-b731-c2e9de31d20c","resolution":{"observed_at":"2026-08-09T18:03:54.230148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.211774Z","title":"Interpretable visual reasoning: A survey,","venue":null,"work_id":"f0746eba-52e2-4efe-8d27-4e7e1ad0acaa","year":2021},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.138224Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:fb5a1ae7d24b9dc13305a0fe11c7b101f519dd02b31dc0ca15bf7897c130cc2d","observation_id":"13ca5d95-21ba-4f0c-83a7-a6ef98b275c2","resolution":{"observed_at":"2026-08-09T18:03:54.216095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.194608Z","title":"Rapper: Reinforced rationale-prompted paradigm for natural language explanation in visual question answering,","venue":null,"work_id":"b67f6c6e-6da7-414b-aa96-367c22d90db6","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.143782Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:12640f36e03497e274577e9aa3bd0220c91d3d02b7088eccbcfcb2bc0ee7483a","observation_id":"9d897cae-9bd3-4bce-925a-d4d70a53e570","resolution":{"observed_at":"2026-08-09T18:03:54.200839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.178294Z","title":"Rephrase, augment, reason: Visual grounding of questions for vision-language models,","venue":null,"work_id":"8cd6b92f-32c5-4233-a211-918666caf61c","year":null},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.148002Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:45fb383bc2cfbf35dd61a054d4e07527fa67a71ee8b7258515d30dcde191adfb","observation_id":"87d224cb-6bc4-47bf-90d1-cea4ba5904f5","resolution":{"observed_at":"2026-08-09T18:03:54.183457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.147398Z","title":"Toward multi-granularity decision- making: Explicit visual reasoning with hierarchical knowledge,","venue":null,"work_id":"6a493e4c-d015-48f0-90b5-029757022fca","year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.157639Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:169bada1ebd82b5a112c79205a0d85faa8c3f89ddeb4721bb1fc06f89a5e116b","observation_id":"9c97c9b4-04b5-43ad-876c-31afd58a9186","resolution":{"observed_at":"2026-08-09T18:03:54.152331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-09T18:03:53.162330Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.162330Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:1944d2838d7e5824d98abeb4c6d52e3b25c79870cb47ac369e83767a5f0396cc","observation_id":"e6cc5687-cb05-4ac4-89df-ad9c12f108cb","resolution":{"observed_at":"2026-08-09T18:03:53.162330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.132057Z","title":"Vision–language model for visual question answering in medical imagery,","venue":null,"work_id":"9d42eb10-a810-43b5-9f4f-0cee6221d5dd","year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.167035Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:20fc42b56a660901ed4f6f53c3ae4202eec32098f682ae3e31a185c21b4b5b05","observation_id":"4ecd5353-0806-429f-bd7d-adc11a0573bb","resolution":{"observed_at":"2026-08-09T18:03:54.137221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.114859Z","title":"Lingoqa: Visual question answering for autonomous driving,","venue":null,"work_id":"fe97cc96-78e4-4332-a990-53ec6ed576af","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.172078Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:b253cf6da9c4d55f6595e5ff79b2c86c94b3d412eb2db7b3246e9c62d844eb60","observation_id":"09bf68a5-9800-46fb-a189-f9a5aa0935ad","resolution":{"observed_at":"2026-08-09T18:03:54.120736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13296","last_updated":"2022-12-26T20:56:01Z","snapshot_observed_at":"2026-08-07T21:46:10.817856Z","submitted_at":"2022-12-26T20:56:01Z","title":"VQA and Visual Reasoning: An Overview of Recent Datasets, Methods and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13296","snapshot_observed_at":"2026-08-09T18:03:53.176903Z","title":"Vqa and visual reasoning: An overview of recent datasets, methods and challenges,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.176903Z"},"links":{"cited_paper":"/paper/2212.13296","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:9af4fb2ffb175bb461ceaf29fe0672b8c11ff78c78fa7e7568aa1f753d404f03","observation_id":"493c5b92-5199-4a6a-9220-f8dc3ab48917","resolution":{"observed_at":"2026-08-09T18:03:53.176903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05240","last_updated":"2023-06-08T14:39:24Z","snapshot_observed_at":"2026-08-04T07:40:25.125871Z","submitted_at":"2023-06-08T14:39:24Z","title":"Dealing with Semantic Underspecification in Multimodal NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05240","snapshot_observed_at":"2026-08-09T18:03:53.181943Z","title":"Dealing with semantic underspecification in multimodal nlp,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.181943Z"},"links":{"cited_paper":"/paper/2306.05240","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:51b81b2bb93a247f133dfdefc9fad4bc01ac693838909e49e03655e92ebb0b61","observation_id":"a8ac84f1-acd6-40fd-a085-f22403b49a64","resolution":{"observed_at":"2026-08-09T18:03:53.181943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.098651Z","title":"Open visual knowledge extraction via relation-oriented multimodality model prompting,","venue":null,"work_id":"74a35eb6-87c2-4810-b0d1-b576f1c504ff","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.187050Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:368109d7e96ae9ccbdb8e06f99a3000751c51fcf277c6c22b8b93a95f06ae54e","observation_id":"201d67f5-58d4-40b1-87a2-6cb46d878e3b","resolution":{"observed_at":"2026-08-09T18:03:54.103734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01016","last_updated":"2023-06-01T05:39:45Z","snapshot_observed_at":"2026-08-03T08:31:03.122771Z","submitted_at":"2023-06-01T05:39:45Z","title":"PV2TEA: Patching Visual Modality to Textual-Established Information Extraction","version":1},"cited_work":{"arxiv_id":"2306.01016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.01016","snapshot_observed_at":"2026-08-09T18:03:53.670755Z","title":"PV2TEA: Patching Visual Modality to Textual-Established Information Extraction","venue":"cs.CL","work_id":"2aac73f0-7d43-4db7-a05e-15589e3ff541","year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.196382Z"},"links":{"cited_paper":"/paper/2306.01016","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:63a060a3f661ba8e33c44293832d30e3f9005406f56579ca094e0bfced8c63a6","observation_id":"45b14339-5b4d-41df-aaf5-dcf88d0e2447","resolution":{"observed_at":"2026-08-09T18:03:53.675681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.067977Z","title":"Recurrent fusion network for image captioning,","venue":null,"work_id":"91a0c12e-32e4-444a-b181-753ee3c103d4","year":2018},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.201585Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:31a6ec9fe7623715241cff08e8cbd965d085fbdd7472a7dfef832ffaaafa7acc","observation_id":"c41710f0-af35-4fab-8584-779222491bc2","resolution":{"observed_at":"2026-08-09T18:03:54.073290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.053395Z","title":"Boosting image captioning with attributes,","venue":null,"work_id":"54654257-a792-4c65-8336-697ce156d569","year":2017},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.206094Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:8fd7525af5251aeab861fb05bb532d07f04776abf0fa78d9d327cf6439fb4bd8","observation_id":"9cc4f3b7-a6f7-44f6-a865-61ff0b598e07","resolution":{"observed_at":"2026-08-09T18:03:54.057716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.037521Z","title":"Promptcap: Prompt-guided image captioning for vqa with gpt-3,","venue":null,"work_id":"30978aa3-f1b1-498b-ae4c-81fa6aea92b6","year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.210754Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:b4a16d9497664db42d0712d20ead452785724259023fbbe5e13cfb1281a55465","observation_id":"ec9a6f63-0b01-4463-8b84-a56fea172bf6","resolution":{"observed_at":"2026-08-09T18:03:54.042647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.021466Z","title":"Injecting semantic concepts into end-to-end image captioning,","venue":null,"work_id":"182a7d1d-e251-461c-b9f9-fdb9ebdfca1b","year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.215491Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:9bdcc193660ca32fca815d224f5c452c314c0632f6fc3a570e8cde3c3a48718b","observation_id":"2b3de275-8ce0-4c20-9023-989fc64a8130","resolution":{"observed_at":"2026-08-09T18:03:54.026025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06553","last_updated":"2023-11-11T12:01:18Z","snapshot_observed_at":"2026-08-10T05:36:57.920674Z","submitted_at":"2023-11-11T12:01:18Z","title":"Visual Commonsense based Heterogeneous Graph Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2311.06553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.06553","snapshot_observed_at":"2026-08-09T18:03:53.647737Z","title":"Visual Commonsense based Heterogeneous Graph Contrastive Learning","venue":"cs.CV","work_id":"37cd3f12-e6e3-4306-b6ba-c962ad9dba94","year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.220310Z"},"links":{"cited_paper":"/paper/2311.06553","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:88c9e37060c672f15a5621852a4b7cc05e191980b3735f903b0a7035f71d78fb","observation_id":"44a583f8-05d8-490e-9b87-d344108e3e9b","resolution":{"observed_at":"2026-08-09T18:03:53.652545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.006270Z","title":"Covlm: Composing visual entities and relationships in large language models via communicative decoding,","venue":null,"work_id":"143057fd-4da2-4c74-ac66-99621dfd603f","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.225287Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:5753d86d8906877adda80f7c208663ca980078acd2dcd761f4f4df28f3234266","observation_id":"576ee7d7-bb2a-411f-bda0-bc7818ca20da","resolution":{"observed_at":"2026-08-09T18:03:54.011138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.990617Z","title":"Bridging knowledge graphs to generate scene graphs,","venue":null,"work_id":"738c4626-a88b-4966-80ef-8b5ad4fa14d4","year":2020},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.229765Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:71fd6ed90f5adc55b2406262bc1a2a9868c76b14f91c2b16822fe22a4be36f0a","observation_id":"859becd4-8893-49f5-8051-0a6a55c14891","resolution":{"observed_at":"2026-08-09T18:03:53.995215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.975202Z","title":"Co-training improves prompt-based learning for large language models,","venue":null,"work_id":"d03e585e-3f35-4d87-b999-3dfdbe6bae44","year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.234699Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:acfbff1f23673b71921622c0d6a5cd5116c58b11df8a66228b39436b91d1153e","observation_id":"17da6dd9-5f85-4145-b893-db9cff8abcfb","resolution":{"observed_at":"2026-08-09T18:03:53.979908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.959133Z","title":"Large language model as attributed training data generator: A tale of diversity and bias,","venue":null,"work_id":"a1764d69-a843-4976-a6a0-9531e3b1c80b","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.239804Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:8a704074c7831dabc1a1f79636abaa98cbcbdaf56a480e3e4c93a1dbd09edc19","observation_id":"352cb6f8-0e86-4031-9d49-c0d03e1ee2c6","resolution":{"observed_at":"2026-08-09T18:03:53.964531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.244544Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.244544Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:d4241b62a903e800dc8aa7086cbc34ef93c0e62e8ad067e4d554682bb8561878","observation_id":"f23dd74d-2d9e-4d04-965a-e696057e3844","resolution":{"observed_at":"2026-08-09T18:03:53.244544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-09T18:03:53.249363Z","title":"Pali: A jointly-scaled multilingual language-image model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.249363Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:dbf51e645c361776373301ea899c0c9a0832d77196f953ad980bea8accabfa08","observation_id":"72faaa99-7ef1-4082-8c89-e4dd2dface47","resolution":{"observed_at":"2026-08-09T18:03:53.249363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.932512Z","title":"e-vil: A dataset and benchmark for natural language explanations in vision-language tasks,","venue":null,"work_id":"81dcb544-7b41-4455-8564-46fea82df684","year":2021},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.254268Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:5e98f2dda0b34aea1a7220417a6330d22281fdd8c2ae28d30f421067c47db6e2","observation_id":"3bd099ee-9f1a-4352-b2f0-45ae8faa3e49","resolution":{"observed_at":"2026-08-09T18:03:53.937640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05081","last_updated":"2022-03-09T22:57:15Z","snapshot_observed_at":"2026-08-07T08:43:05.185097Z","submitted_at":"2022-03-09T22:57:15Z","title":"NLX-GPT: A Model for Natural Language Explanations in Vision and Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":"2203.05081","doi":"10.48550/arxiv.2203.05081","metadata_source":"pith","pith_arxiv_id":"2203.05081","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"NLX-GPT: A Model for Natural Language Explanations in Vision and Vision-Language Tasks","venue":"cs.CV","work_id":"f3daa5c5-7086-4ae8-ac47-87277e5f0572","year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.258591Z"},"links":{"cited_paper":"/paper/2203.05081","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:5f38ee4aa31f9ce39514d5b816cca6e7f7ed89c031c8e203e2f5855c43f332e9","observation_id":"37485df7-ccff-4907-a53b-d104118fabc5","resolution":{"observed_at":"2026-08-09T18:03:53.411763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.083385Z","title":"Improving vision-and-language reasoning via spatial relations modeling,","venue":null,"work_id":"3a752a41-caa4-46f9-9dbf-6e2fe97fcb4b","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.262983Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:e118cd44f6f52ab1ea34f979a6945d7a5b1629c8bac86d78b1f4e889164702c6","observation_id":"7e32c95e-1594-4df8-a12c-5606734b071c","resolution":{"observed_at":"2026-08-09T18:03:54.088306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T18:03:53.267186Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.267186Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:bb82fe0e84aa46bf575d1d78716722405333adeaa9d0059ffd06c58f4cb9d169","observation_id":"581bbdad-363a-4dde-a6dd-c3153a860408","resolution":{"observed_at":"2026-08-09T18:03:53.267186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.915345Z","title":"Chain of thought prompting elicits reasoning in large language models,","venue":null,"work_id":"fe5bc0b5-8cb2-43cd-8803-b7f2ae562306","year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.271528Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:3131b04bbf8755190b61b31a2d8a3535ea4e87b0c01250be6a13be9df7303e93","observation_id":"49a49c73-976b-48ed-b03b-edf5ca7db438","resolution":{"observed_at":"2026-08-09T18:03:53.920798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.276014Z","title":"Re- flexion: Language agents with verbal reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.276014Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:dd0baf302ad00a369faeb3e2ee56167b15f095e506ccbbbf176fb0aa644a6d99","observation_id":"6301d550-8086-41db-9af7-2e5291357021","resolution":{"observed_at":"2026-08-09T18:03:53.276014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.280509Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.280509Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:59030bbc1240833c20662a265e30353d8d0478a1aedfaec55c577381f2ff35b4","observation_id":"48cb50bd-3dce-4d0a-b28a-5375e5202022","resolution":{"observed_at":"2026-08-09T18:03:53.280509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.878467Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge,","venue":null,"work_id":"1bacae69-295e-416e-a426-f35eb07ad10c","year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.284831Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:92fbb4a03a58de1446f60d16f4ebec9482576a1189f44dff792bdf2781280245","observation_id":"ffc1b197-7c6f-4a7c-ab72-dbc64b4aa10b","resolution":{"observed_at":"2026-08-09T18:03:53.883686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.861803Z","title":"Vizwiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":"f9a0012c-73a6-4f0f-b4ab-9429ab187156","year":2018},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.288845Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:94bb362ad6c7e2ba15eed6445da1991f69e7558f9045ca5bf4084081f740ddff","observation_id":"2c7d8b91-5454-4649-8acd-ffe132606bac","resolution":{"observed_at":"2026-08-09T18:03:53.866801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.293183Z","title":"@ crepe: Can vision-language foundation models reason compositionally?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.293183Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:1b118281660d5bc4c96ca47118593aeb25a258547fce551fe9663de45d5dfda8","observation_id":"b4a91c25-d32e-4a6f-a5d3-5e61ae026181","resolution":{"observed_at":"2026-08-09T18:03:53.293183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.297452Z","title":"Qwen2.5-vl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.297452Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:ec5fec6c5496aef20f9891be6fc258008eee1b08accf8d5cb0d8f673394947ca","observation_id":"4ebb616e-16a6-4190-a4bd-660078d895be","resolution":{"observed_at":"2026-08-09T18:03:53.297452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.833680Z","title":"4o mini: Advancing cost-efficient intelligence, 2024,","venue":null,"work_id":"783e3a61-db2e-429b-a88e-5be8825e9af2","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.301534Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:d316384dc0ec4cdad87cdeb88e75c599112ce90de7dcf07f98b1a39ca9aa6748","observation_id":"1f87daaa-787a-4922-9028-3e10613dc958","resolution":{"observed_at":"2026-08-09T18:03:53.838477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.818182Z","title":"Hello gpt-4o,","venue":null,"work_id":"0118c62e-9b6a-4bd1-9357-20c2c8d7da63","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.305912Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:3626c1f715745dc9df5dbb1ae71483f3b57338548429c6e3ccfeae0e05fe2e4f","observation_id":"39ae7dd0-f211-4e54-874e-c68fc8233f56","resolution":{"observed_at":"2026-08-09T18:03:53.823122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.802513Z","title":"Introducing gpt-5,","venue":null,"work_id":"3b5f63ea-d859-41cb-9c08-4d34b49b5e47","year":2025},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.310555Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:deee1334290bd4787fba732ad17daeac4890201c6c5b0090982b38d75485aa78","observation_id":"b03738ee-646c-4502-8f5f-188b317569f9","resolution":{"observed_at":"2026-08-09T18:03:53.807507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.785969Z","title":"Learning to localize objects improves spatial reasoning in visual-llms,","venue":null,"work_id":"7be54b1f-9f2f-43bc-b56b-f858bfa88985","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.314572Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:0b822e15a3f55022661100465399d9ab392fcc552156b4fd7c311003e905ca3c","observation_id":"51f45e83-d199-4222-bc23-0a51e053ed2b","resolution":{"observed_at":"2026-08-09T18:03:53.791861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-06T15:15:51.847048Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2501.10318","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.10318","snapshot_observed_at":"2026-08-09T18:03:53.492309Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","venue":"cs.CV","work_id":"7f335fdb-61d5-4876-a98a-6e90154b1d98","year":2025},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.318565Z"},"links":{"cited_paper":"/paper/2501.10318","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:3c803c78bd4fb0a582cffac7f7dd00b28df874f70ba902545bd67d5e386bdb96","observation_id":"8a1837d5-e9a4-484d-a90b-0c32bec08abb","resolution":{"observed_at":"2026-08-09T18:03:53.497001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.769933Z","title":"Eliminating the language bias for visual question answering with fine- grained causal intervention,","venue":null,"work_id":"cdded969-6520-48be-b025-fc24191a4bd0","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.323075Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:56dd972a0c20be46e5d34a4b39dc3ca246dceea00e3c6e1df9098953814c3de7","observation_id":"d453f790-a4cd-49b5-b5db-c2bb756e6185","resolution":{"observed_at":"2026-08-09T18:03:53.774850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18351","last_updated":"2025-08-07T01:39:17Z","snapshot_observed_at":"2026-07-06T20:12:45.239449Z","submitted_at":"2024-12-24T11:24:56Z","title":"Multi-Agents Based on Large Language Models for Knowledge-based Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18351","snapshot_observed_at":"2026-08-09T18:03:53.327797Z","title":"Multi-agents based on large language models for knowledge-based visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.327797Z"},"links":{"cited_paper":"/paper/2412.18351","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:efda0c219f60ce1104fabd1abe61bbed8672e35cab6df1483c4da20df6185771","observation_id":"bbc7420b-076e-4705-9814-f9e1961ef556","resolution":{"observed_at":"2026-08-09T18:03:53.327797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12746","last_updated":"2024-10-09T16:04:39Z","snapshot_observed_at":"2026-07-06T18:33:07.118735Z","submitted_at":"2024-06-18T16:06:38Z","title":"Diversify, Rationalize, and Combine: Ensembling Multiple QA Strategies for Zero-shot Knowledge-based VQA","version":5},"cited_work":{"arxiv_id":"2406.12746","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12746","snapshot_observed_at":"2026-08-09T18:03:53.453755Z","title":"Diversify, Rationalize, and Combine: Ensembling Multiple QA Strategies for Zero-shot Knowledge-based VQA","venue":"cs.CL","work_id":"5c78dece-cc8d-4c2c-bfab-a9804ffa2489","year":2024},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.333286Z"},"links":{"cited_paper":"/paper/2406.12746","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:da286ec1add663f1581b6db973baca92b495746e4698185f48eb67490fc8448f","observation_id":"e538e280-5cfb-46b7-a517-36b48a81d7a5","resolution":{"observed_at":"2026-08-09T18:03:53.459183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04231","last_updated":"2023-03-29T08:48:35Z","snapshot_observed_at":"2026-08-09T21:37:35.280163Z","submitted_at":"2022-12-08T12:28:23Z","title":"Harnessing the Power of Multi-Task Pretraining for Ground-Truth Level Natural Language Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04231","snapshot_observed_at":"2026-08-09T18:03:53.338237Z","title":"Harnessing the power of multi-task pretraining for ground-truth level natural language explanations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.338237Z"},"links":{"cited_paper":"/paper/2212.04231","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:3c43e38e137fcb06d982da9529596dd1f2feecf11b130cd1a7f9b7122b08015d","observation_id":"cfe634d1-97ed-4d42-a49c-e3f291b3d187","resolution":{"observed_at":"2026-08-09T18:03:53.338237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13812","last_updated":"2023-10-24T21:21:00Z","snapshot_observed_at":"2026-08-03T19:26:04.926669Z","submitted_at":"2023-05-23T08:28:38Z","title":"Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for Improved Vision-Language Compositionality","version":3},"cited_work":{"arxiv_id":"2305.13812","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13812","snapshot_observed_at":"2026-08-09T18:03:53.430719Z","title":"Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for Improved Vision-Language Compositionality","venue":"cs.CL","work_id":"492be271-5caf-41fa-83f2-37513e7c6188","year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.343259Z"},"links":{"cited_paper":"/paper/2305.13812","citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:8e24b57ced2afccaccab1a6261a79d84d1c590203723057388f406e6fa7a075c","observation_id":"614997c3-fa05-4221-81c6-761128f6e041","resolution":{"observed_at":"2026-08-09T18:03:53.436188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:53.348354Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.348354Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:73e3d72954a2c82706965bd3dac9cc219f81379e9a8a4a0d4e214d16db0e1b85","observation_id":"886cfc9d-39ab-4256-aaa3-4f24b4803d38","resolution":{"observed_at":"2026-08-09T18:03:53.348354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:03:54.163069Z","title":"Available: https://openreview.net/forum?id=L4nOxziGf9","venue":null,"work_id":"b79a18c9-f5d8-4137-8d7e-811af1b3c420","year":null},"citing_paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T18:03:53.152560Z"},"links":{"citing_paper":"/paper/2502.00711"},"observation_digest":"sha256:10dc41dcee6b66608b746119c4fe4c9519d9c6dab9f51b94d512b62611888b73","observation_id":"0426853d-c62e-4887-8569-5ba81f7ec38d","resolution":{"observed_at":"2026-08-09T18:03:54.168000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00711","last_updated":"2025-09-02T05:28:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T17:57:32.459082Z","submitted_at":"2025-02-02T07:54:55Z","title":"VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":6,"verified_fuzzy":30},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2502.00711."}