{"as_of":"2026-08-09T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcb81d0b49f0028740d75f2eea6a9d9ce4dfb67a9c277ce410b0d557e45ab70d","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:16:51.452335Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29915/citation-record","integrity":"/paper/2606.29915/integrity","json":"/paper/2606.29915/citation-record.json","paper":"/paper/2606.29915"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Don’t just assume; look and answer: Overcoming priors for visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f4dfcd79f00f0c22ad6e4a2accc452b2c28d59936ace76f357128a81462cc87f","observation_id":"02b8d00c-4f93-4420-83ac-e36dd654eddb","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:5c9606ef845d7359c81576625ea46d43d5edaccc1c86d451fb434817e80161ab","observation_id":"f2005225-0a92-4941-b183-d69a499f2df9","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:59764a661098312d2473954b465c950e4a74f44f271dd0232092e507a0778501","observation_id":"ee40dcdc-5370-4c95-a3d8-967bd50e467a","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:512c8d9307d0e5c101ac2c44bfd05081e6454b56ee444f99aa9a4717aa077e4d","observation_id":"304897c1-bffe-4823-93be-ce55427eff1c","resolution":{"observed_at":"2026-06-30T07:14:22.073999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T16:08:16.864468+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:7d303890c2ba8b92145ebc63434f0db81c6e3665f7c7ef9b46777cb05b6177a5","observation_id":"d7f7db7e-3c3f-49a4-9b6e-ff5569249d74","resolution":{"observed_at":"2026-06-30T06:24:19.583033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Are we on the right way for evaluating large vision-language models?Advances in Neural Information Processing Systems, 37:27056–27087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:b4569ab0d1187f7ea27d9b6e6476d42feae6c37634619c419c971ab3ac8b0742","observation_id":"27fd4ac7-7e01-4009-a5d2-eb51a41c2ce3","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Beyond question-based biases: Assessing multimodal shortcut learning in visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:6bfaa10c2d32e373e19c0c69409baf3be51bd322361bc2b2f2dae69b91d2e3a2","observation_id":"381137bd-9993-4a30-837d-a17fd62a0a69","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Gemini 3 flash: High-efficiency agentic multimodal understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:e85507b86a8ee49c26deadee42f17c60215f11ffd5ea49536a5b806dd0e04c96","observation_id":"567c85f0-f740-458e-9cdb-ab0859677745","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:98400815d7422870a9afdb53c333ccf95616a3d6ef6634dbade3a0dfbd4a9616","observation_id":"681706ef-c37d-430e-a621-b8633a67aebd","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:b90e5f4d3d29d671f5a6004741de3f865ffb3b484380265777284b1b1a77595a","observation_id":"a41934e7-2ede-4f66-a00b-f76a93870f80","resolution":{"observed_at":"2026-06-30T07:14:22.071060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:451be9130375ed650fd7ead75a9948566d183ea0e4a3bbe14a92473b8cb66b2a","observation_id":"9cb8e320-72d3-4e2f-9a86-0ee4dd2e9462","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:3888de2d3e5dad344459bb1a401884ba6768ca5f1a5f3b0d28c21cf5c6345890","observation_id":"a8a852af-ba1f-4046-b480-da8f5a67508c","resolution":{"observed_at":"2026-06-30T06:24:19.584388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Raven progressive matrices","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:9353916632d5bb4db4049fc8fba919e9e4ac9c38c31beba1373ac844984ccdfe","observation_id":"cee35312-3f35-48a6-b8d7-35a4c954a5f3","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:0cacdebc41042f203bb7102e8a6624b91b1053de9cbda66d5cd90fd8b581ad04","observation_id":"77debea3-3348-4396-bc2c-d0d78d85c398","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f8044590d35af89d45d6a974801b91f4d4fd18353b199df2e90eca638bec47d8","observation_id":"bc695b8e-3edf-47f5-b018-e49f0a68ec03","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Imore: Implicit program-guided reasoning for human motion q&a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:1fbe013927f1b01043a3e2c6ff57e83555defa737312814ef06514e57941eb8a","observation_id":"c59b158b-a7c3-4a51-b698-9e6950b63d02","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vision-sr1: Self-rewarding vision-language model via reasoning decomposition and multi-reward policy optimization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:9af5151d3fe54ff40002be748489cb51cf629a7c0f9c30ddbaa852d90db0c6f4","observation_id":"68e336e7-f3a2-4420-ac31-b599f80d5a74","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2034},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:afba1123ea005cab3b2e96f0b5511715745a70ce05fda52f578f6a431d6df132","observation_id":"fccf2cf1-8ace-4b76-a479-ee35882b6513","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in neural information processing systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:df3cc3d354fe9c05cedbf117960bcc9bde2190020591c1716f7593ac715025ec","observation_id":"ca8cded6-2d71-4a6c-8461-950e1b81a47f","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:5618994bf91d5963720cf769b23ea029009edc546424dc241f44da92dd126832","observation_id":"9bfd8663-6812-4d8c-a8e8-ff796bca7233","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"A computational investigation into the human representation and processing of visual information.WH San Francisco: Freeman and Company, San Francisco, 1(1):4, 1982","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:77f188c65213fcfb8d28e6fe7823ba59949654af2b23df58ee10ebfafe7d4261","observation_id":"08a5f508-d2ce-4c02-bce3-ef8ce740177d","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":"2504.05299","doi":"10.18653/v1/2025.acl-long.718","metadata_source":"pith","pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLM: Redefining small and efficient multimodal models","venue":"cs.AI","work_id":"810cc87f-f6bd-4443-9673-5e30982426b9","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:d4d4ca31c4c731ebd0f4742e2eb9e929009fc7a571841c1ef90cd3e5113f2889","observation_id":"33942dd2-30ed-426a-acdc-5777d7bab885","resolution":{"observed_at":"2026-06-30T06:24:19.588487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:b481e49323192c51d310f28a5371b976e34f27f654fcd49db4bfa5755b811de1","observation_id":"1f35ee56-26f9-4737-8384-360dc2ed56b0","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Pkr-qa: A benchmark for procedural knowledge reasoning with knowledge module learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:9c7f426aeb39071b10068830b48376bfda093dee2a5ad18f4a15feff97da1d1e","observation_id":"59f4b493-5f3e-45a1-9c08-676339e7dbae","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:07537c0092221f8a718716ef47c99190503448843e67c8be2458628090eca315","observation_id":"bf751ef3-1174-4d11-b2c2-3d524abe4764","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:273d88873650e20f00b0e362e853c70386e4192c8960791ba8228c1248c93955","observation_id":"ccbc4a4e-de5e-42a3-a945-99785e6dda8b","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08889","last_updated":"2024-06-07T05:45:02Z","snapshot_observed_at":"2026-08-02T21:49:10.577943Z","submitted_at":"2023-06-15T06:45:46Z","title":"Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion","version":3},"cited_work":{"arxiv_id":"2306.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.08889","snapshot_observed_at":"2026-06-30T06:24:19.584161Z","title":"Dissecting multimodality in videoqa transformer models by impairing modality fusion.arXiv preprint arXiv:2306.08889, 2023","venue":null,"work_id":"af6ca6bc-1e89-434e-afe6-bb3ef37b94f1","year":2023},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2306.08889","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:6c5a55da2a359df6d4c2e76cd09f168779082727f46eecbceca9e7a360a4ae2c","observation_id":"5e974d39-0d41-4161-a197-8def928049a4","resolution":{"observed_at":"2026-06-30T06:24:19.585935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:b6e1e95092132abc72df7dd6f008a238b274cbfa1b7a0df38810f409784b3a40","observation_id":"96d199c0-0ddf-41ce-be50-f39ca01f802b","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:4f3123e796d89752c950fefd679b810cf626fe139f6f7261b25c887235c81900","observation_id":"b6c63f4b-5c70-4a23-962e-6d5d7467de5c","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Grounded reinforcement learning for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:da05fb1cb99c54817b1ec2228cb4eb02fc7d38b1726ace852f18aab59345b53e","observation_id":"c8ad17e8-4c85-44a1-bf44-cc49afe30d08","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:40c10b2d91e32dda2d0fcc4a9c539c15c4149a1b0f214048b2a151ce6cc6becd","observation_id":"324d5f17-1452-403d-810d-b9ed2a1b16ee","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:ce54d0debd3f6ae3d7f62e839c544c8b4006bf3dff5b60777f590f96152f88e4","observation_id":"1a146134-7fb7-4d46-a9fd-869d1b678983","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:0333fb6017271cee644775e5afec763eaa09614a4b95f5ffc766e0fc512f79f9","observation_id":"ee428d28-21d9-4781-98d6-00f5aed48bb6","resolution":{"observed_at":"2026-06-30T06:24:19.577448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv e-prints, pages arXiv–2504, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:7a010ebeef6703e4d089c1942b3281c16a356b4a504c3d1df38918bd47abd4e4","observation_id":"beb3ca3b-32e5-4dfb-9342-9ab25c3dc33e","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Language prior is not the only shortcut: A benchmark for shortcut learning in VQA","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:3f40e72eae6669cdeb79ce8aead489c44399ab4f518ea61e2478f68e5c1a11dd","observation_id":"3817647c-3a84-414f-ad02-75b509cb8a2b","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:fe800aff59fe7ea104fce5a5030cab888e1dc35bd204d613d2f875c81724a104","observation_id":"f8492fe8-ccf3-4c5d-babe-8f2ea424a8b6","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:1ff8f8140aea88a2f2539ccb1000101ce00ffea6bf4d16f44f05a8573059bee7","observation_id":"8edf08a1-565c-4f43-8536-fbd4300c7b4f","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning of vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:950db15040e8e3937917e4e389f3fc550e1a87ba53d54c289ba0edfc0c9d35f0","observation_id":"c6c2f491-059a-47b0-bc86-75c48693c019","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:e4b29fea3f293969994c0c52693bd2d8d2da8147ac3ccac8383b62d93e602f1e","observation_id":"df0e8031-8d0b-4862-becf-f94c559ca7b0","resolution":{"observed_at":"2026-06-30T06:24:19.592194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:3d863466e09ed3a6d06c1bf904725a611e4b32df81a0999b75c1a9228edf3337","observation_id":"d76f3881-784c-40ee-96e9-31edee27a189","resolution":{"observed_at":"2026-06-30T06:24:19.581646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:c0eebc77facc4fa11c6e874b6f9036822001ccf09fe6f04a66cacc6886a2908c","observation_id":"4ef73406-d8cf-452a-bf48-4a59a9975570","resolution":{"observed_at":"2026-06-30T06:24:19.590819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:4f21d03b0f425d1893755e82a990495c44c2db543adec072e324784d6912b0ba","observation_id":"9f84fce8-0f5a-44ee-a14e-82980fd649b9","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Procedures as a representation for data in a computer program for understanding natural language","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:d1aeaefbdbc4255088c17ba8942c4a014a13cfa0f8a9ab116d3cfb2c80933cb0","observation_id":"d1bc2cc3-8b94-4cda-897f-1267bc9e62b6","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Learning structural descriptions from examples","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:0559d7b1f60f76551ba8547677704a2df62a5478275c2b78b078120475781b65","observation_id":"a06c8446-a93e-497e-abd8-c75bdbe0a6fa","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:08fe895e87325e9a19a0a308720ac96d4d8115544cc4c34f2e8c6ce6727e20e4","observation_id":"a4642844-0455-4f73-8e94-04cae7b4956a","resolution":{"observed_at":"2026-06-30T06:24:19.569669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Realworldqa: A benchmark for real-world spatial understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:6d2ab1493815bd4da20480755c67859f98b8dbd55e6dce247b46870596c02673","observation_id":"5ea1c24a-e558-4ac0-877b-e6af5a798835","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:b685a6b951152542f94fcc528d0b6f2c8390ce106ae2a1d829562afbceef8023","observation_id":"40a64413-d951-4af7-bb72-51832351807d","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Neural- symbolic vqa: Disentangling reasoning from vision and language understanding.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:e66ca7cf67f0f4c6adf52ddca6fe46a2aa68d3508068ed8c41ecd5fc04e02a61","observation_id":"ad88ec18-9174-4c7f-abe2-bb20bd58f2d1","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:eb2d0c4882bda90de0000115dfd1b8fbe6b16b78997440b994ad33a2d1432c78","observation_id":"deaf51d4-4060-4d61-b0d3-0f4199430f68","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:c1e6c031dfb940eeb603fda28ad2ce75753b5e5bef2780c45504775683003ed9","observation_id":"2fa4283e-d302-4393-83fb-ed25a5e22a12","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Raven: A dataset for relational and analogical visual reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:89a5491685abedd5a1aa8f27deba15797b65972177d352af89078e38fc22560f","observation_id":"25ac8f50-9b0e-4b04-aeef-587f5588266e","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13428","last_updated":"2025-08-19T01:03:45Z","snapshot_observed_at":"2026-08-05T19:05:35.154723Z","submitted_at":"2025-08-19T01:03:45Z","title":"Mitigating Easy Option Bias in Multiple-Choice Question Answering","version":1},"cited_work":{"arxiv_id":"2508.13428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13428","snapshot_observed_at":"2026-06-30T06:24:19.586131Z","title":"Mitigating easy option bias in multiple-choice question answering.arXiv preprint arXiv:2508.13428, 2025","venue":null,"work_id":"4685584f-fed6-4dc5-99c5-797341c4f7ba","year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2508.13428","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f5a7990bc6a130b6538702a39a3eaf8fac4f7116a49d8380c65f1556dff06da6","observation_id":"5d838940-73f2-49c8-87ed-0113bd0f5b32","resolution":{"observed_at":"2026-06-30T06:24:19.587769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:ad3d284ba5d1c08c2c41de76c000977d0c6d61d555483d06a78ad80771cbd76a","observation_id":"00e4f341-87a6-4d92-97a7-6bf27303ca4a","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Physreason: A comprehensive benchmark towards physics-based reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:f1cff3064f64c9874a471ad24ee0b3aa77844cbcdd87a6757346a58907f4fbdb","observation_id":"1df64fe7-114f-4e9d-97c2-1dd1c9a1d1e2","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Multimodal chain-of-thought reasoning in language models.Transactions on Machine Learning Research, 2024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:9d7e0d3688b5ab567010473b0567b1f69506dc78e94940861dfd9b819be88196","observation_id":"87f9e699-cdf2-4b17-80b9-ca1a51bfb1f1","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:16:51.452335Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:7dfd4c475b55a1cd51763eb80d5ef5fbb29914dc51440de182465bb611233320","observation_id":"cb99c87c-ba04-4766-b386-b18c03a4e5dc","resolution":{"observed_at":"2026-06-30T06:16:51.452335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2606.29915."}