{"as_of":"2026-08-07T15:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdb3bd99b5504a722028c2f736274bf8b5fc5f3388a48a17ee17f6c33f50736d","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T14:43:21.866055Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:19:52.487643Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T13:15:50.537044Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"cited_work":{"arxiv_id":"2603.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.05256","snapshot_observed_at":"2026-07-03T02:17:35.996569Z","title":"Wiki-r1: Incentivizing multimodal reasoning for knowledge-based vqa via data and sampling curriculum","venue":null,"work_id":"cc677454-daea-4a29-b968-5d290d7ab39a","year":2026},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T13:11:54.384284Z"},"links":{"cited_paper":"/paper/2603.05256","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:d2dc149626e2184ea555bec61a86547f79cd492b93f6c18aff5078eaa40200d9","observation_id":"9f4c332e-dab1-4a1a-80b7-36f3ab08e987","resolution":{"observed_at":"2026-07-03T02:17:35.996569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05256","snapshot_observed_at":"2026-07-14T23:55:24.006436Z","title":"Wiki-r1: Incentivizing multimodal reasoning for knowledge-based vqa via data and sampling curriculum.arXiv preprint arXiv:2603.05256, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T23:55:24.006436Z"},"links":{"cited_paper":"/paper/2603.05256","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:9994fa43898df2f20096693fdc208ca3fb12ecf5257bb8ce6534fde413db8d03","observation_id":"d2ec3ef4-9853-46aa-85f3-7dc53a3d6866","resolution":{"observed_at":"2026-07-14T23:55:24.006436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05256","snapshot_observed_at":"2026-08-06T00:31:16.714259Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T15:12:29.751279Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:16.714259Z"},"links":{"cited_paper":"/paper/2603.05256","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:59b63120d2e7d6d8a6430b8b07a360f3c0c3108bca8a1fed62c7ba5d9d04db0c","observation_id":"693e040e-3774-403a-83e3-8afd4206c81f","resolution":{"observed_at":"2026-08-06T00:31:16.714259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05256","snapshot_observed_at":"2026-08-06T04:19:52.487643Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-07T15:12:29.751279Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.487643Z"},"links":{"cited_paper":"/paper/2603.05256","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:476acac7dd6fff3fa9115e85d60dc99392b0da24e20a603f688d1d46e43f0a2f","observation_id":"a8d15d2f-478c-4f03-942e-75e496b055cc","resolution":{"observed_at":"2026-08-06T04:19:52.487643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.05256/citation-record","integrity":"/paper/2603.05256/integrity","json":"/paper/2603.05256/citation-record.json","paper":"/paper/2603.05256"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Qwen2.5-vl technical report.ArXiv, abs/2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:3951dacb58d853636c52c71f1e7bf4e29a1cdf8312564f94e2c87fbe8eec12b6","observation_id":"0af5cc2e-73f6-434d-b2b5-9b9eb0a27ade","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Can pre-trained vision and language models answer visual information-seeking questions? ArXiv, abs/2302.11713,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:ffb9d5cd0918e5fe2ae98816a2892655f7ddf57f423800357c15a02940ded648","observation_id":"4fd4f9ae-c567-4359-a94a-2355379060a8","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:9dd18a19060218889737f69ae6656e39dad52f8fd6dc74f6d22666a188c313c2","observation_id":"9276f29f-33bd-410b-af3e-8da03a405f2f","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:a851e7856b143e9c941f9a2ab703742041501a750d2cc34856b51e2ec65f8554","observation_id":"30d93720-acf0-4999-9137-0f9bc717ffea","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03003","last_updated":"2017-04-10T18:25:29Z","snapshot_observed_at":"2026-08-01T21:11:47.069345Z","submitted_at":"2017-04-10T18:25:29Z","title":"Automated Curriculum Learning for Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03003","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Bellemare, Jacob Menick, R´emi Munos, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/1704.03003","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:185972e7d66b110888f467a2eda70c11e04fda6388d3303a2038147bfb3e63c5","observation_id":"ff88c41b-3399-4216-8557-de964ce69775","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Hauptmann, Yonatan Bisk, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:baac5713b397bc2781e74a538efd93827c39f05d64e3156a149675d9fa1633e0","observation_id":"30f15c67-efb6-4c83-8562-bc0caaa8c014","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Belongie, and Oisin Mac Aodha","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:d5516ef772318259e5ce3eeba1fb9135caa328189d27a21921d921029e380613","observation_id":"45ae7642-29a6-439c-b041-bdd165e1a10f","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Open-domain visual entity recognition: Towards recogniz- ing millions of wikipedia entities.2023 IEEE/CVF International Conference on Computer Vision (ICCV), pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:99d6914b2572668bc0b657469543d05597dcae801b36d3c297be28189cf5de39","observation_id":"fa81d54c-c886-457a-b8a6-020ae65de71a","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Ross, and Alireza Fathi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:f3d5b52d35573ed51da0cc917525cbbc8af8ef7f5192f039425c15dc5976f873","observation_id":"7fd21357-4079-4621-96bd-7f946cac61ec","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Unsupervised dense information retrieval with contrastive learn- ing.Trans","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:2427e4b01d8e90b6e877f721d92dc00f9ddefe0011dbe19a5b34447bb21eaf53","observation_id":"15d1301b-0bb4-41c2-9127-2b4cf3e91d3f","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17391","last_updated":"2025-05-23T02:01:15Z","snapshot_observed_at":"2026-08-07T14:45:46.054518Z","submitted_at":"2025-05-23T02:01:15Z","title":"Curriculum Guided Reinforcement Learning for Efficient Multi Hop Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17391","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Curriculum guided reinforcement learning for efficient multi hop retrieval augmented generation.ArXiv, abs/2505.17391,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2505.17391","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:e4f9793c5f98cd63e74deb82d5f88868b3d896091b8279b99f7090c67d4eeffd","observation_id":"4a4d6b1b-9181-4a1b-968b-c05b004996ec","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Search- r1: Training llms to reason and leverage search engines with reinforcement learning.ArXiv, abs/2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:5be795112dd3276e6cfd456d018be73d9b092573cd75cac0386b5a329b71aec1","observation_id":"5398e1cd-7782-4cc8-8d7c-d5d88e78bc37","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:78776a58d24fab3ecba49b9fca99b42b526253883888ee6ce9db3018735ee7d2","observation_id":"98529806-ac7b-4936-ac38-3b33847399ab","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Jabri, Trevor Darrell, and Pulkit Agrawal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:db60f0bd832342d1d40e2bcd2a55f3258bbcf25c926e377f5670921ae09b8425","observation_id":"0a4504f9-1ac3-498d-a5ef-d9ff8b9a0876","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03809","last_updated":"2022-10-29T10:08:13Z","snapshot_observed_at":"2026-08-05T15:50:39.183704Z","submitted_at":"2022-10-07T20:35:58Z","title":"Retrieval Augmented Visual Question Answering with Outside Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03809","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Retrieval augmented visual question answering with outside knowledge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2210.03809","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:e73a89a5b628a6e0e2f0f3a1d60237f4729cd8045ea9e012edc53791fc8db299","observation_id":"14a35a32-a5df-4179-96f1-e87b8be39445","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Improved baselines with visual instruction tuning.ArXiv, abs/2310.03744,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:633dc93c9981295dd42c8b9bcc14b2bbb1f7e99021d45a0e879c758c1a61ed2a","observation_id":"a2e15ba6-34e2-4b2b-899b-1750464a0388","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge.2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:cddf3d6f7ce6a5c0e3fcb66afd4fa896e0abd91e81ad67f8f3f4f8209fc071f5","observation_id":"53d3cd3c-64cc-4712-a6d5-4ed13e5abdab","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:2712e694ef806fff0a94907f16b0f20cfcd7131304980c3dcb97eaeafba1d3c8","observation_id":"43c699fd-0156-404a-aebd-9023a4f53c2a","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Hoiclip: Efficient knowledge transfer for hoi detection with vision-language models.2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:2f4ec23cf7a109991e5b69483adbbc793ca1ce79d4f8d39fdcdccc1a4b016750","observation_id":"df1b24c4-8c11-4e82-916b-4f9b53c66b66","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07224","last_updated":"2019-10-16T09:07:43Z","snapshot_observed_at":"2026-07-06T08:29:56.164821Z","submitted_at":"2019-10-16T09:07:43Z","title":"Teacher algorithms for curriculum learning of Deep RL in continuously parameterized environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07224","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Teacher algorithms for cur- riculum learning of deep rl in continuously parameterized environments.ArXiv, abs/1910.07224,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/1910.07224","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:409ac1ccee6310acc2e862acdfde9c5a7315bbb44e4a7528b84885f922514833","observation_id":"c6a5215c-499d-4598-a426-66dd4594c653","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08876","last_updated":"2024-10-14T20:31:13Z","snapshot_observed_at":"2026-08-04T21:17:26.164677Z","submitted_at":"2024-10-11T14:51:00Z","title":"RoRA-VLM: Robust Retrieval-Augmented Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08876","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Rora-vlm: Robust retrieval-augmented vision language models.ArXiv, abs/2410.08876,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2410.08876","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:a706ec1bf35929e20c326d1e139419108752cc362e33023d6bf05add8a39edd9","observation_id":"1b8e8219-715a-466d-bd38-2561b2015aad","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02347","last_updated":"2024-01-04T16:43:46Z","snapshot_observed_at":"2026-07-06T17:11:42.641129Z","submitted_at":"2024-01-04T16:43:46Z","title":"Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02347","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Mining fine-grained image-text alignment for zero-shot captioning via text-only training.ArXiv, abs/2401.02347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2401.02347","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:c44e258266ea70b4f0719a5c67c1fac892040241b4df3ff7f87ad34c2d82bb3b","observation_id":"42e539cf-d27a-478c-a954-38630ba99d89","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.21122","last_updated":"2026-04-07T14:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-24T03:23:34Z","title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.21122","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Noisygrpo: Incentivizing multimodal cot reasoning via noise injection and bayesian estimation.arXiv preprint arXiv:2510.21122,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2510.21122","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:66600373584eed11c161682e954f38a4394dc36afea026d8a4e4389de6c47182","observation_id":"25e289fa-11bc-4a9f-8f27-182287debe3d","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Da-dpo: Cost-efficient difficulty-aware preference optimization for reducing mllm hallucinations.arXiv preprint arXiv:2601.00623,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:da1cd60c3f6516055991edd6a30ec2a4f2c4c5724e9fed6e8a0288f5eba6ecb6","observation_id":"ede4a04b-f298-4062-b4ce-3454ece8599b","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:ec974574d11fe77aaffda3888da0b94e9683f27a2dce826cc85527afba34914a","observation_id":"584dec0f-5852-4129-a3ae-6ebc62f2ab84","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-07-06T21:05:44.765030Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Efficient reinforcement finetun- ing via adaptive curriculum learning.ArXiv, abs/2504.05520, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:d272f1456711540494d38a888808c86d729e38dfee7496de067cd28606caf3df","observation_id":"e534df68-a116-4a92-8f05-d92c6375fc09","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Eva-clip: Improved training techniques for clip at scale.ArXiv, abs/2303.15389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:f251f4b4682978180f2b60223ef43f9870046cd08fa00d906551ce1f0041cbee","observation_id":"c703e467-541e-4475-8e23-6bbed5b26eeb","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Denny Vrandeˇci´c and Markus Kr ¨otzsch","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:4af04d569380a3458caf4bc1ac130c7e1a452b0633adb7fd568eb2c1180dbb47","observation_id":"1b8712bc-ab4d-4959-8816-63fc7a3e0b9a","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"URLhttp://dx.doi","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:3e686b653814ac468f460daad207d3f8640b52f1b470e358b16eba9f3944045c","observation_id":"af17a9cf-6d77-4038-a236-4966c15d81a9","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.01753","last_updated":"2019-02-21T01:17:31Z","snapshot_observed_at":"2026-08-02T23:13:12.652289Z","submitted_at":"2019-01-07T11:28:36Z","title":"Paired Open-Ended Trailblazer (POET): Endlessly Generating Increasingly Complex and Diverse Learning Environments and Their Solutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.01753","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/1901.01753","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:67904d8f9e9c6b3daea6ca79732a026ece6b90c8f296e5dcc13b6e52017ec74d","observation_id":"14a6461c-7480-40a2-b2fc-edf7a0cd197b","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Zhang, Zheren Fu, and Zhendong Mao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:77c4d6d51e194fe4377441471aed44995fc88c7990686beab124c65d9ab3ef18","observation_id":"f496a94f-5f40-4ad5-a35d-e4b4a4238497","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"de Ara´ujo, Bingyi Cao, and Jack Sim","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:2dd262c0471223e24e6a3a51b523e3ce49cfcc0e7f13c67b912bcd682cf4a58a","observation_id":"d0fb5d2a-2a82-4e36-9101-604b24e143e7","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Mmsearch- r1: Incentivizing lmms to search.ArXiv, abs/2506.20670,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:484b2c94a061ba21f28d47c512983d587f20c55ef95cffbd148ddedbef3f7710","observation_id":"09c7f8a3-dc2b-4c08-8da0-8a6d1fae7926","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13570","last_updated":"2023-10-24T13:24:25Z","snapshot_observed_at":"2026-07-06T16:36:11.682777Z","submitted_at":"2023-10-20T15:08:17Z","title":"A Simple Baseline for Knowledge-Based Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13570","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"A simple base- line for knowledge-based visual question answering.arXiv preprint arXiv:2310.13570,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2310.13570","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:248cbe6a617c677b3ba6e94fd1478229af2c65e3b874768fe53b132a088518b7","observation_id":"a1d35240-cf00-4363-9214-d66c64820bb5","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12735","last_updated":"2024-12-02T02:34:47Z","snapshot_observed_at":"2026-08-05T16:52:46.144105Z","submitted_at":"2024-07-17T16:55:42Z","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12735","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Echosight: Advancing visual-language models with wiki knowledge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2407.12735","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:dc8d7325679d0eb10cbef1580d2dde18bb62e593920cda298356eadb1e15ca2e","observation_id":"909a70fa-6c91-4148-aec9-d57a7798f601","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Dapo: An open-source llm reinforcement learning system at scale.ArXiv, abs/2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:5d46bbce1951042cd8f0b3de47acfe7940be97cea078cf176a0589278c69bf1c","observation_id":"1a602055-d793-4878-b3ac-157051c6e352","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-06T11:35:06.948357Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22607","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Vl-cogito: Progressive curricu- lum reinforcement learning for advanced multimodal reasoning.ArXiv, abs/2507.22607,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2507.22607","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:0be3594d2e724fdedc92f3bc94d75dc60197294785f4634b9f1a74c9ad22454b","observation_id":"d6797923-e4a0-476d-9806-a043a665a98b","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"A curriculum learning approach to reinforcement learning: Leveraging rag for multimodal question answering.ArXiv, abs/2508.10337,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:49025029ef609d5c0d787f2b46b1f9346b3a6f990a09ff1a107cb96b1537a9fd","observation_id":"147f527f-1a30-4f3f-b68a-29f9c48c84ad","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"The CLIP I-I is the retrieval with the visual similarity score from EVQA-CLIP 8B only","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:93b060e63f98e06592d0e57180c3464aa19757c9bb60748a7dd0f40aa365e059","observation_id":"687f5520-d56f-4d6c-b7f4-50f7f249cdfe","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"As shown in Table 7, our method requires substantially fewer training samples while achieving superior performance","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:8e7539312e875d22ec054df11365b71555679e357aeca18eb21f51529f0336d7","observation_id":"42d86120-d739-439f-84b7-a9b979c2faae","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:99d3f30a1c40d0203ce3ea880f6f568019d871ce62045f9eb20c5320fd3ea158","observation_id":"a51a36c9-eba9-480d-9a97-f563dcf4e12a","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 4 inbound Pith citation observations for arXiv:2603.05256."}