{"as_of":"2026-08-06T11:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:056684a365c175eae2ebb4e5c50901234e4c99286588de2102e24dc30707075f","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T01:23:32.849326Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:56:43.645518Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T13:56:46.683829Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.20705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20705","snapshot_observed_at":"2026-08-05T13:56:46.683829Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","venue":"cs.CV","work_id":"22221153-6729-48d7-b445-cf4a87d2e2cd","year":2026},"citing_paper":{"arxiv_id":"2608.03733","last_updated":"2026-08-04T14:28:42Z","snapshot_observed_at":"2026-08-06T10:26:24.822802Z","submitted_at":"2026-08-04T14:28:42Z","title":"Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:56:43.645518Z"},"links":{"cited_paper":"/paper/2604.20705","citing_paper":"/paper/2608.03733"},"observation_digest":"sha256:89c594e85ef20a124ef59d134a1b63533b5fd82975fff244c60bff926e34d9db","observation_id":"fd97243f-5c04-4656-9560-48fe1ac9104e","resolution":{"observed_at":"2026-08-05T13:56:46.759454Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.20705/citation-record","integrity":"/paper/2604.20705/integrity","json":"/paper/2604.20705/citation-record.json","paper":"/paper/2604.20705"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"37358a19-81c6-4a58-929c-78551124ffe9","year":null},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:f7165c7e8ecb1aa309f9d2fc55ccb65817daa54009696048e9f7e364a70de33a","observation_id":"260c7929-66a1-46dc-886a-60cae45f37e9","resolution":{"observed_at":"2026-05-23T09:37:50.520874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":"c4e81134-007c-4622-8fd7-c8886c3a32c2","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:983d6622ab9bdb8547d47c782bd9124193babb1a53dcf49e96b7d6f336aa8a76","observation_id":"c7bc843e-ed67-49d5-b2b5-ee1778e69b07","resolution":{"observed_at":"2026-05-23T09:37:50.496360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:3b43643de5e2e4b25ce104feac9ab59a2b4172513c637067e4df1e0f71b8e313","observation_id":"5a27f76a-3d07-4553-94af-98249770fdaa","resolution":{"observed_at":"2026-05-11T13:36:08.779407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:ed30fe06209c589471376d1892aff6a06ac5daf0155b88e505506f5292ff2f3f","observation_id":"678f4dde-8fc0-427c-b2fb-f565c4cac325","resolution":{"observed_at":"2026-05-11T13:36:08.759358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":"cc30c727-ad18-4477-971b-7bbdd9cefb64","year":2022},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:5b173a7479b58782b3412744e260ffb21e7dcf14d0437589a296c50c16ee0511","observation_id":"519e7bb4-19da-4c46-995d-2253a66a0ee4","resolution":{"observed_at":"2026-05-23T09:37:50.543294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"87237bbd-e365-427f-a358-d357719d61fa","year":2020},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:0e4b487324e4adba012b0cbf1e5704d80c2a0a9eafefbce530fd3c856e947539","observation_id":"6de91f32-5026-4cbd-9d09-454f11cf5282","resolution":{"observed_at":"2026-05-23T09:37:50.500216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep clustering for unsupervised learning of visual features","venue":null,"work_id":"f8431fa2-ba4f-438b-b690-148d9c015f16","year":2018},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:203ab175b0b7d5306dab1c0b22ccb4feadda2e69c53004be6be9a36e75719f00","observation_id":"1ba7cdb8-2fec-4404-a476-cc43c0cc9c8b","resolution":{"observed_at":"2026-05-23T09:37:50.486793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learn- ing of visual features by contrasting cluster assignments","venue":null,"work_id":"bb865edf-20d6-416b-9582-d2582f85c0e8","year":2020},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:3fd40f40bbfbd66b49b767e3b82608ea49e7283d62fcb59061b4014cb377a94a","observation_id":"29c08d6f-4c75-4f23-8b65-9442b54d5e6e","resolution":{"observed_at":"2026-05-23T09:37:50.481372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"4c36d87e-43b4-4ad9-9a9d-c476bec81db2","year":2021},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:b55412f73867dc49186614c31ec8014a6383e3616a4885a9bda7b2ee2a8bf9b4","observation_id":"893ee7a6-dac2-4328-a9d6-b79e94a853a9","resolution":{"observed_at":"2026-05-23T09:37:50.490749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are we on the right way for evaluating large vision-language models? InNeurIPS","venue":null,"work_id":"fa8e29d7-ae9b-4d0f-9729-8209fe6cb22a","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:a3472ee54178137de08f3f0bc2a68d22e2403da79b426aa8b338775c55cff8ad","observation_id":"1fe64c31-31d5-4297-8359-d454c9701b3a","resolution":{"observed_at":"2026-05-23T09:37:50.507615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative pre- training from pixels","venue":null,"work_id":"0729c78e-9674-4d36-b71d-b4ad7a6672a0","year":2020},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:eee270c72620ddc11b49c1ea2a9d809ca5848fef3ea6a7ede2bce916f8a64f11","observation_id":"00797619-2f47-4ff5-bc5a-1123148b7e87","resolution":{"observed_at":"2026-05-23T09:37:50.373032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"1572e3bc-8564-4cf0-a8cc-56ff534fa5bc","year":2020},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:fc851c45e2e4f43884e06355ea0e565c4c4aca67a3c3deb0e8aecb38c8dc9346","observation_id":"dd787b00-f372-4301-ac3e-37847a5cfde3","resolution":{"observed_at":"2026-05-23T09:37:50.377078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"d199e076-7ac5-4bfb-a3d1-969e659a06d7","year":null},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:a05fb33eba71b5291eef9b53268a0f04f02a623ab6f4c49fcde38cca578002ce","observation_id":"f4b18c12-05ee-4ddb-96b9-8a3b0ce58f19","resolution":{"observed_at":"2026-05-23T09:37:50.405150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"605d59d3-c74f-4795-95d3-609027594463","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:a3e620b8798b68ad9ac5697f0b3e00af1d31d55e6bd6e84433a1fef51b06f13f","observation_id":"daa06f95-2bab-40aa-872a-89bedc694d43","resolution":{"observed_at":"2026-05-23T09:37:50.398759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"8b659cfb-54e0-4f57-88be-a0cf3b05f223","year":2019},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:f913c73c6abbb4a0e44b4a96330fc7ef147c3f36898e79808e93904a4096dd5c","observation_id":"0a7e73d1-be31-4e56-ab9b-096a84c2f5be","resolution":{"observed_at":"2026-05-23T09:37:50.409457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsuper- vised visual representation learning by context prediction","venue":null,"work_id":"6144d92c-c9f0-43cb-8176-2d0eaf7f2f0a","year":2015},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:c9f0c669bdcb6b632d05b7ce062518bf9e11be0ee6b38e57a3a0483e76b03dd1","observation_id":"deb9e839-53b7-4a34-8173-beb01eb4a784","resolution":{"observed_at":"2026-05-23T09:37:50.469225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:3fb8c0b2394bbfa6e0b867abd561745e5594c90fd84eaa7bf02b21ed2f9ed53c","observation_id":"b950c390-7cfb-4074-bba5-af510f3531bc","resolution":{"observed_at":"2026-05-11T13:36:08.870137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sugarcrepe++ dataset: Vision-language model sensitivity to semantic and lexical alterations","venue":null,"work_id":"470753d3-5d21-4d59-97b0-e0f11ecb8c01","year":null},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:22bb497f2ee6fb531b8d9b0ef526e177117905965ce9c551b738f65811decdf2","observation_id":"b5840e98-8e44-4e93-be20-49f813b53cb8","resolution":{"observed_at":"2026-05-23T09:37:50.473309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva: Exploring the limits of masked visual representa- tion learning at scale","venue":null,"work_id":"ca7aca04-b514-4730-ba9d-186f6416d5f3","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:afc4b3b8fbcf2ff503c5fb2c7b5456553695d390391b50e071b81c78ad835a3f","observation_id":"038b08ac-291e-422f-b352-997195d78f74","resolution":{"observed_at":"2026-05-23T09:37:50.512661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un- supervised representation learning by predicting image rota- tions","venue":null,"work_id":"26274b4e-81b0-4d2e-949e-ca3a30a74e9f","year":2018},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:a8ebb625a116ba98404521ddaa8a0d91d973126b26a3ca26132f00cc91cd73b3","observation_id":"cfa8c795-34ce-4f2c-8ea6-2b0b928eb6b9","resolution":{"observed_at":"2026-05-23T09:37:50.516466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bootstrap your own latent: A new approach to self-supervised learning","venue":null,"work_id":"0916b747-fbf9-42a8-8c80-fa19ce7618db","year":2020},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:2e9cba4c329f4ad0271eef4b24acb9d1af16ab9f64dcc583177bed9f1a0c2fc9","observation_id":"88020b11-fa72-4ea7-9fe6-3b6b80d346a8","resolution":{"observed_at":"2026-05-23T09:37:50.539508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:cc19db9dbc42d938d63dc20222ed93a17a0b3cb3a38529884e639def38e09476","observation_id":"3b772da9-4a27-433f-9759-c0559c37e9f7","resolution":{"observed_at":"2026-05-11T13:36:08.659468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16416","last_updated":"2026-05-17T05:54:56Z","snapshot_observed_at":"2026-08-02T06:39:30.995519Z","submitted_at":"2025-10-18T09:22:40Z","title":"SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning","version":4},"cited_work":{"arxiv_id":"2510.16416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16416","snapshot_observed_at":"2026-07-03T10:58:03.012896Z","title":"SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning","venue":"cs.CV","work_id":"d9b2bec4-afd4-4f09-bb30-dc63111b174a","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2510.16416","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:4b1e6bd05dcb035540b5d9c60edb0b6ef792c9559c098afa0e8e013d747be270","observation_id":"2f04a502-80b2-4872-8fd8-e9d950ff0a1f","resolution":{"observed_at":"2026-05-20T00:02:57.484204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":"8f9a5948-77a3-48f9-9443-3fec436af252","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:639a9d474771552b3e4e0a7ec921f4f35fee4a4b0504a674a586de5076dca81d","observation_id":"ceb19fab-9b3d-4fa7-b481-43a4ba4d7ade","resolution":{"observed_at":"2026-05-23T09:37:50.460941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"a58231c0-e913-4f26-ba3b-fe3095f4821b","year":2020},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:4d03c15193ed2d12f35aeb84a00b163f29da84b8111438328d35af3cf558f07a","observation_id":"3e3c9789-eb81-4034-b0eb-06be2026dfe4","resolution":{"observed_at":"2026-05-23T09:37:50.457155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"36f57467-c39e-43e2-a26b-f32912628457","year":2022},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:ece42ca3cd8e7433d4cca90c13ef014f5932b90e8c4fe013d6cf770910b66dbe","observation_id":"794cfba8-0e6b-476a-9ee8-2df42d097097","resolution":{"observed_at":"2026-05-23T09:37:50.391003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:56b57d859da23a26744e43bff8a0d44e0624d8fe17d1fe45814d450eacad4517","observation_id":"5c412a58-09fd-4cb3-a362-de815ed439c8","resolution":{"observed_at":"2026-05-11T13:36:08.865648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:076a12212aa0bdca7b3f291fcaa9caf633cf0000b1bfcec468cc291481126416","observation_id":"0ecf6064-e608-47a3-ab62-4b1c0329d284","resolution":{"observed_at":"2026-05-11T13:36:08.792449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03135","doi":"10.48550/arxiv.2506.03135","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models","venue":"Open MIND","work_id":"f971b57a-47ff-414d-80f9-50ccac0c8e78","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:3ebc79d1a5e4c3a43916c65089fac99e3a4960073fa6f376e4d5caa6df30c1c7","observation_id":"f74776ad-b8d7-4ed0-b424-ff7e276642ea","resolution":{"observed_at":"2026-05-11T13:36:08.581149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":"89c60aa9-9d5d-4a9c-93f2-a82ce9fdcb22","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:83af9e792eb3e8db57f98d0e886461320eba73f39fc85d07b2393dbf03d1dee6","observation_id":"c9540e78-ff6a-44ec-85e5-7c9ad553a4bb","resolution":{"observed_at":"2026-05-23T09:37:50.313330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:9461bed475298c827f5f7fdf5646843d53f5647876b05fee84e3842e5d0502f6","observation_id":"5479c03e-29b8-4f31-b514-cb40dfc63a56","resolution":{"observed_at":"2026-05-11T13:36:08.726255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.03726","doi":"10.48550/arxiv.2305.03726","metadata_source":"pith","pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","venue":"cs.CV","work_id":"33cb3a7a-6091-48db-a246-802bbb055f43","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:a33054bc9d0618da5d7a4ca4e6f386231b7574e5f63467822817c3a9cb8ed82f","observation_id":"da42ec44-bc0f-4b05-bf6f-be5f1de66c33","resolution":{"observed_at":"2026-05-15T02:43:48.053680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:31:42.191937Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"3dc06391-8eab-477c-bf31-df06fe8bfdb8","year":null},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:0bb528a5c6079c571e0416e6cf335c751a5ca9ef9c30246ee24b6cd0aafbcbb1","observation_id":"55580ff7-2933-4045-b829-1c30cf8c13e6","resolution":{"observed_at":"2026-05-23T09:37:50.317375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Correlational image modeling for self-supervised visual pre-training","venue":null,"work_id":"372838f3-c0b2-4375-980b-7c833f35d306","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:de66339d48760c6dfe841760c1206f9dcfd6748c6cc1c2cf48fadbb16028f608","observation_id":"61c047b1-c908-43ea-b229-df68a73628a5","resolution":{"observed_at":"2026-05-23T09:37:50.328458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":"2504.00883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-07-03T16:18:37.298889Z","title":"Improved visual-spatial reasoning via r1-zero-like training","venue":null,"work_id":"57345232-ffec-48ff-ac2c-e58800253c84","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:67ead9461c2c99e16e340c9dacef9397337e6a5abb54e935e4cd08c394f3d6e5","observation_id":"75226c71-ce97-427c-87db-a0944021055f","resolution":{"observed_at":"2026-05-11T13:36:08.748348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"ba6545f7-a104-47dc-be49-bf0acc4ead75","year":2014},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:993e56322b6699a9498b9c3ab84310fd8446c282819119fb10b192dc161cd814","observation_id":"45b8ad45-8804-4acc-b3b5-d38344be5b35","resolution":{"observed_at":"2026-05-23T09:37:50.362888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual spatial reasoning.TACL","venue":null,"work_id":"a8848ed8-5823-4231-8de0-dea7470aaf1c","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:5034144c3560b0dd6e4b4d3c30846a34bfa03d6754c75ec651c71a77adbe56eb","observation_id":"450d6001-2a2b-410b-bb2a-dd023c5bc7b9","resolution":{"observed_at":"2026-05-23T09:37:50.324720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"fcb483c2-03e4-479b-84fe-cb69f384b0ca","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:57c89ddfe7c249f09608f48d63910ec52797e37f29ed9d2f80bb74a3820bbe96","observation_id":"d6b3e8c3-86e2-4ae9-b711-646368e5ae17","resolution":{"observed_at":"2026-05-23T09:37:50.335615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench: Is your multi-modal model an all-around player? InECCV","venue":null,"work_id":"fe89d9f2-aaab-4366-a907-860f80f8d8e4","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:4e1bb95b4d22fe1a02d551a818c9ea4a257d5c73e3e659acd206bd31995dbac3","observation_id":"ab6c62c3-027b-4bfe-ad40-ed40e9a94902","resolution":{"observed_at":"2026-05-23T09:37:50.305499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.27606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.621153Z","title":"Spatial-ssrl: Enhancing spatial understanding via self-supervised reinforcement learning","venue":null,"work_id":"0098e73a-eeda-4380-bda1-a16750db5b4b","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:0ef8ec2f5e02976d78fef5ca71d32903f52563ffbcd09d2fe19bffe0609ab8cb","observation_id":"27d1c04d-607c-4cbc-b8a3-76406c449774","resolution":{"observed_at":"2026-05-11T13:36:08.828062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual- rft: Visual reinforcement fine-tuning","venue":null,"work_id":"5f4f762d-0d3b-42ff-8d7a-c7f225137eaf","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:7ef015fd2f7d229df6d81e332c72ff3ec9dfd6f180bf0ae076f7bee0903e8918","observation_id":"2fc0114f-1199-4283-b7cf-ccb76b2ae1c5","resolution":{"observed_at":"2026-05-23T09:37:50.301849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:520e2e84d07458b8a482fbdc775a4e14948e5348d927a6b92429e7a53dffa702","observation_id":"809ac577-0d4a-4546-b8e2-90440b037115","resolution":{"observed_at":"2026-05-11T17:58:54.896552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts","venue":null,"work_id":"c895e5af-0e7a-4366-8fc2-d9046a69b480","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:87cef6ad0f87857862862aff28c6b5b284b1dd85ecb75ed2ca4986bbb3aa3e5e","observation_id":"27bbc79b-fc4e-4dad-a127-632a143ef0a3","resolution":{"observed_at":"2026-05-23T09:37:50.298257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:b20ec66436bb03823917f8d8f306b68f3e8048507e48672580baf32f4354fbff","observation_id":"d468757c-1a7d-4194-8c31-c2238b417063","resolution":{"observed_at":"2026-05-11T13:36:08.597995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation.https://ai","venue":null,"work_id":"8f8c53aa-2986-4ab5-90af-c72f50e0f72d","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:037b0892cb9702e0e82f357b87ab5bff64fbc27c994ea437c2665b0271186d48","observation_id":"e60766ee-691e-48d1-8319-6abe0e486a1d","resolution":{"observed_at":"2026-05-23T09:37:50.290848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":"161020bf-a025-45e8-94d5-1c256fbff827","year":null},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:8626610ba702ebe0898b89c8d7414d21580e10bfef44bf4c3dfa6dd12f4efebe","observation_id":"e061e1d5-45bb-409c-becc-56d03b8844e8","resolution":{"observed_at":"2026-05-23T09:37:50.294569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:2652841555cd1dbebd493a77d2e344ed8481c1e9f99bc34ed217e86c0190190f","observation_id":"f23922af-7a14-4dbe-92d3-277a2d355292","resolution":{"observed_at":"2026-05-11T13:36:08.810006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:9f910ea99bb3f4ab49ab031c3fbd4252b4dd4840ca19d6db12dda1cd82b0f569","observation_id":"13f89b78-6918-46b9-a6d3-6560fb050141","resolution":{"observed_at":"2026-05-11T13:36:08.839114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":"0f44b32b-9e66-4b92-99ac-1a391204efe6","year":2022},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:e7e1fdeba697d894bf0ac66542a0db072fb5b0e789ffc36a89c9c9a571f4c1cc","observation_id":"a6b55d36-e588-4736-8ad7-c97b7654a8af","resolution":{"observed_at":"2026-05-23T09:37:50.309561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context encoders: Feature learning by inpainting","venue":null,"work_id":"7ec0649f-1496-486f-9a24-709cc895aad2","year":2016},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:d885f7ea37ce39f2b9516d87bc821968612782317714804de369b6b59de6b43c","observation_id":"2714f8db-d069-49b9-ad7d-35547320de7c","resolution":{"observed_at":"2026-05-23T09:37:50.320920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T11:32:22.336259Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"a33e7050-0881-49b7-95ff-ef370f49bd09","year":2021},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:8432d8d69b934fdc1e29a9ad2223d35911530f80e1d0d88ca6cb61d7d91870db","observation_id":"71d9472f-15b4-4786-aa7a-76748b494902","resolution":{"observed_at":"2026-05-23T09:37:50.465153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:610d57e5fcedb54ab40a3377a9c4e45e42fa22b20c6414462f5c0bd439689d01","observation_id":"b26737de-543d-466c-b3d2-b6aaef3be2ee","resolution":{"observed_at":"2026-05-11T13:36:08.667118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:741dbad8ac45982c81d293a91a98eafdf3cddc74966c46d9db951cedc0eb3774","observation_id":"8b73a474-f45a-45f0-8bca-06235fbfd290","resolution":{"observed_at":"2026-05-11T13:36:08.851864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:60a24895c6f2b647d4175ff7135a5d58f884d268f85ae48bf9dfc60e8e730ff8","observation_id":"80ccf399-67a6-40e1-a917-5b01964db5d2","resolution":{"observed_at":"2026-05-11T13:36:08.572435Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:0cff35d37343f64e14e56a20843712aaaf35469e7138ff77177136648b2d9eba","observation_id":"b9504a04-894b-4e5a-983c-b2da6a2847d1","resolution":{"observed_at":"2026-05-11T13:36:08.576979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:9773313d53ecb6e6a2e230fdaea53d4de95ec2333f1e0c3677fa8eaad68d431c","observation_id":"081620ee-690c-4fc0-86ae-b0827f3d1f50","resolution":{"observed_at":"2026-05-11T13:36:08.844575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:e44d3cba56c33c70515e045d5c6c9d38184630e9aa3c39a6c5d59228e524cf78","observation_id":"2ab89138-c7f7-427d-bbe9-9b69ab18d67b","resolution":{"observed_at":"2026-05-11T13:36:08.822073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"f917808a-c097-4cc8-b436-a0e062259428","year":2022},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:4d1bcd8e56ebc4845c577b8b7a6034425f3b8899a7791ef9ae2caccf740b216e","observation_id":"d035e965-e854-4323-89c1-d9a3953a5dc2","resolution":{"observed_at":"2026-05-23T09:37:50.477546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"0692b7c5-5965-471a-8a93-c351397b1e3d","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:a776912c34d9da8e1e636d340562c310227ac77307a265bb7d4109ba0c238e98","observation_id":"6253173f-d227-4eab-bff6-e5711facdd51","resolution":{"observed_at":"2026-05-23T09:37:50.524656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:bcbfef4bccec81bf46ecbacdc2749609beec9f773c79a0baa576d453596153c8","observation_id":"8519b1fe-bf08-4257-a92d-1d8c83d7f77d","resolution":{"observed_at":"2026-05-11T13:36:08.814689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixel reasoner: Incentivizing pixel-space reasoning with curiosity-driven reinforcement learning","venue":null,"work_id":"21845b71-b52f-4de9-8ea5-add79764cde1","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:cd55230620a81c9a0b01bb56e00f9f5b42af48a45026a738f3e6373bc243d45f","observation_id":"4cb32b16-38b8-4bcf-bf2f-0811bdd26fe1","resolution":{"observed_at":"2026-05-23T09:37:50.535693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"ba408ef2-108c-4e18-9623-acd85a24ca7b","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:0dd7e69eddde1cde172628dc380e543b83834601b3f2e92c67d4bb98fc29c652","observation_id":"70e5b200-4fd3-4d98-9252-9bc780772809","resolution":{"observed_at":"2026-05-23T09:37:50.453066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":"de0c3a64-c992-4625-ae7d-f7b4a357d969","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:6b40227eac6607e88650782f3a9e9029cd5821ff602a3e9c0d6f800f8416cb6c","observation_id":"aaf30619-55bd-4342-a66e-dad0355c4977","resolution":{"observed_at":"2026-05-23T09:37:50.445129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-06T10:51:25.025627Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:e9cd0c5e8a3bc8103ed75167643c70a950943d1fdafd03494e88875ac212a368","observation_id":"9a247ef6-a82d-46aa-b669-1071141cac14","resolution":{"observed_at":"2026-05-11T13:36:08.805123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vicrit: A verifiable rein- forcement learning proxy task for visual perception in vlms","venue":null,"work_id":"8c9ce47d-1277-46ae-a0b5-bf020650387b","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:65e0375c66fdba50378fd6ed2b8431c5ba04ebdc3f63b12370c83a3686150790","observation_id":"9e35c6d6-165c-4e4b-8bbd-2d5be9181d8b","resolution":{"observed_at":"2026-05-23T09:37:50.531901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":"2504.07934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-07-04T16:29:57.248099Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":"3af2dc47-c7ba-4654-9a4e-89fdcbfa9bc0","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:d3d29d2e75eb7d43ec055d6e2442e93f3b7c34a5d4bf5f89404e5e7fcc353a32","observation_id":"4bbacae6-4a7b-4f3b-aaeb-2cb579d8f937","resolution":{"observed_at":"2026-05-11T13:36:08.856150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jigsaw-r1: A study of rule-based visual reinforcement learning with jigsaw puzzles","venue":null,"work_id":"659e85ba-e742-4f40-866a-7c14ea27eb37","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:156b111af3fe266d47c21d681cdf3291810dbe7ac2172ee63bcea940b3cc713a","observation_id":"1681915f-b3bf-406c-afdd-25718f8f9862","resolution":{"observed_at":"2026-05-11T13:36:08.652216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:27391e915ef5929c13315322b36ceba04ff5147a87178b21ab228c3728ffeb83","observation_id":"bcb35224-6a9e-4f1d-bb75-7b1284dc1b73","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"be7ec71d-7799-49c1-a568-0d75102fd746","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:463b0a87be5cc3ea188c47eb94442c0bf25e4b962445656441f025aa9a1f2fca","observation_id":"6c7eda69-9da2-41ff-8dac-829d76e372ea","resolution":{"observed_at":"2026-05-23T09:37:50.528152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:03.047380Z","title":"Visual jigsaw post-training improves mllms","venue":null,"work_id":"996cee18-93ec-477f-a105-a8ed911af90e","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:e556ab23eb11102c27ece22398b6c282eb86564fa161615879e5d7c9bc3b17cb","observation_id":"305dcce8-101f-404f-b91b-67a4ccdb4fc1","resolution":{"observed_at":"2026-05-11T13:36:08.680333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-03T18:18:56.117009Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:6cb99ecf78ddfa948c98a017b93f6b0651bcf561bdae17e07007e037575eb25a","observation_id":"93ddcea5-acf8-4ffb-8237-018a3f76e2a3","resolution":{"observed_at":"2026-05-11T13:36:08.615360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised object-level representation learning from scene images","venue":null,"work_id":"e773e313-d717-4fe8-a38d-a662cb477d1a","year":2021},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:699f0122da4c1aed741d588fb93b610bb96f7dbbd2bce81068b2addc5ab40e78","observation_id":"a3015ae6-3e4b-498f-b5e4-51e6e6d2875a","resolution":{"observed_at":"2026-05-23T09:37:50.394749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delving into inter-image invariance for unsupervised visual representations.IJCV","venue":null,"work_id":"d3fada48-138c-4587-b74d-7fe90fda87a8","year":2022},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:dcfe386058d244bef7768153d698d41e2f41882e3c70419516ea2a08e79d3d3f","observation_id":"d01f57a8-f546-4faf-8cae-b5d82cb33a44","resolution":{"observed_at":"2026-05-23T09:37:50.386791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked frequency modeling for self-supervised visual pre-training","venue":null,"work_id":"409769a7-3bb1-4078-92bf-29990710e561","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:38a704386c653b0091ca9a1bd0d9b2a0f03aaefb2b5cb146b768894bfff141dd","observation_id":"9775d78e-cf60-4eda-bf4f-b5f9f2cfe3fb","resolution":{"observed_at":"2026-05-23T09:37:50.441337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth any- thing v2","venue":null,"work_id":"17d9627b-d9b6-409a-92e1-25b3d88cfcbf","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:d3baf3cc3d0b3129498f9948b74276018b92dd9833047be0fd28442578add4de","observation_id":"98d290cd-b7d1-4857-a35b-5c5e73eca5f4","resolution":{"observed_at":"2026-05-23T09:37:50.449235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How to evaluate the generalization of detection? a bench- mark for comprehensive open-vocabulary detection","venue":null,"work_id":"abaf4981-0c5b-48f4-ae3d-2327d9e24ef1","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:6fdf2cd1794953fcdaf0d6c61bc119dacec1e7219348182543994f297dc72d38","observation_id":"af98848a-06ea-4dda-8b6c-663bf307169b","resolution":{"observed_at":"2026-05-23T09:37:50.425312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:cf688cafb51f5d0d61269b7df9442c33f70a596639090622d90a0024ce96f475","observation_id":"37c41524-cf77-4589-b7b7-e8f28b166e66","resolution":{"observed_at":"2026-05-11T13:36:08.832543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-04T01:05:26.679801Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.07954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-07-05T11:41:02.675605Z","title":"arXiv preprint arXiv:2504.07954 , year =","venue":"cs.CV","work_id":"35656592-ffc7-4aef-9baf-0f8694c0c987","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:53f6d2f5e5c40ac38809d04568cce49fb8f450c3a8bcbdd7050e2114caa86fd1","observation_id":"013d3648-2590-407f-9943-9e8bc8b7be78","resolution":{"observed_at":"2026-05-11T13:36:08.633735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-07-06T22:05:08.089548Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":"2507.22607","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22607","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-cogito: Progressive curriculum reinforcement learning for advanced multimodal reasoning","venue":null,"work_id":"fc91531c-9a13-468f-873d-46824cc7fb59","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2507.22607","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:cc1ed1cac424497564beb7b39398ad135a7b7bc74eebeab48c145e3204582df8","observation_id":"82fd2cc8-b1da-4349-97f8-e1b19fe59164","resolution":{"observed_at":"2026-05-11T13:36:08.628351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"74ae0a89-6e03-4d7e-8cd3-a70aaf74b05a","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:10f2b010ae6cfa6afcc048d4a7cc6a3102ed801db3e77baf49aefd728931b336","observation_id":"7897cae0-cbe9-414b-a511-49f6176688a4","resolution":{"observed_at":"2026-05-23T09:37:50.429163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"9b6c4512-8432-4767-8670-9d52a0f99fcd","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:91cdb015eaad446367b2c861407e52facd71728a55264ecf05383182994dd04a","observation_id":"785a44ac-6f1c-4d8a-8882-d8bc0f501496","resolution":{"observed_at":"2026-05-23T09:37:50.433096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online deep clustering for unsupervised representation learning","venue":null,"work_id":"f3a08658-006a-4e38-8153-38a9547b3c0e","year":2020},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:4887f683d34ed4e4bccd14f6b776405ca05d380d6263201a9e4bf829cffbe14e","observation_id":"66c10490-5f20-48f6-a458-0ac81f389d47","resolution":{"observed_at":"2026-05-23T09:37:50.437208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In ECCV","venue":null,"work_id":"7e494e96-67ac-4cd7-9358-c00c78b1e8f8","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:e227640c83ae0bb315aee14d520a03b392f3c09eb5a397f27a6833cb41af2415","observation_id":"18f68011-3757-4d0c-9051-27a9782c586f","resolution":{"observed_at":"2026-05-23T09:37:50.413172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenar- ios that are difficult for humans? InICLR","venue":null,"work_id":"9a0493ab-4a37-46ec-bdf6-e071f830242b","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:d0bf89b81ff7e8dd4d75abfdc244b12bb6c44cf7f27420f27cc35043006517dc","observation_id":"174fe4a7-f5dd-4cbe-b0d1-fcb98e2163d9","resolution":{"observed_at":"2026-05-23T09:37:50.417301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.14362","doi":"10.48550/arxiv.2505.14362","metadata_source":"pith","pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","venue":"cs.CV","work_id":"5f6cf57b-2407-4127-b39c-d8a61494e474","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:17c8c325d596a3486f39db75c5667910f24a969ef4c8684696509b01b383681e","observation_id":"43e8db37-78f0-47b6-8ad9-cfb67458cd7c","resolution":{"observed_at":"2026-05-11T14:42:57.181531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":"86434aa8-4fa5-4568-8930-8c760ec5adf6","year":2022},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:316f5026cfaa46e0bd3dc58bea6005ad1e904f375a1b025c47b3f95bed0e9bbe","observation_id":"c7adc2e5-d8fd-4fb6-a0af-f7b9fd059301","resolution":{"observed_at":"2026-05-23T09:37:50.421382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:c7f0e9df1d82f33779699c36ec652e1c8517fe30a83f8cb67ba2bbfdb8b09329","observation_id":"8811d8eb-aa12-4f9c-971b-d2fd7cab62af","resolution":{"observed_at":"2026-05-11T13:36:08.610800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:e5d5cf212bc893ab8d4d6b1a84199df0be2ac65528a9e229f1547d9049fee099","observation_id":"c4efbcf1-98a0-4bfa-9c6e-6c4dd460d0ba","resolution":{"observed_at":"2026-05-11T13:36:08.587864Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":53},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2604.20705."}