{"as_of":"2026-08-04T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa83def276ed1ecd2cbb1f2be513c670e67bb550c563477f5653c4898df3af27","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:13:21.565082Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03234/citation-record","integrity":"/paper/2606.03234/integrity","json":"/paper/2606.03234/citation-record.json","paper":"/paper/2606.03234"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Probing classifiers: Promises, shortcomings, and advances.Computational Linguistics, 48(1): 207–219, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:12028c0b122d2d5f08ba6e42f51514d911f791e089b8288ead591ab289638ec0","observation_id":"726fc06c-2251-462f-94f6-a29321e6aeb6","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:a6b873ac1d16c2f2439353d0da9e284f387559ebcdb1a9ef2c15ca2e1c4128a1","observation_id":"250b1fc2-6150-4f56-9b67-d4e689fd5286","resolution":{"observed_at":"2026-07-02T02:06:27.261820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22543","doi":"10.48550/arxiv.2510.22543","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Fapo: flawed-aware policy optimization for efficient and reliable reasoning.arXiv preprint arXiv:2510.22543, 2025","venue":null,"work_id":"f2f9f31e-a167-4a8d-8ce9-010f41b124b6","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:765c74bde7a0ff669a0e3b483ebec4c8709fdd226ae5cc7962b311acdd722bb4","observation_id":"19c9a916-55fe-4077-8575-8634ae7dc557","resolution":{"observed_at":"2026-07-02T02:06:27.258479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:cefda7b1ce6c7b29cd9d2e8d380cd3d3773abc85d9171d81d23125bb53d309a6","observation_id":"69e080db-36eb-454d-a052-5d12825e52b2","resolution":{"observed_at":"2026-07-02T02:06:27.277353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Reward inside the model: A lightweight hidden-state reward model for llm’s best-of-n sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:be8464c58869c12d6b89e1cf8214de7a4cb733fec4e1d25fd6d09e2ccfed24e7","observation_id":"14f14886-e3b6-4760-a694-4d6fd2fc28e7","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04878","last_updated":"2022-11-09T13:34:45Z","snapshot_observed_at":"2026-08-03T08:43:51.537904Z","submitted_at":"2022-11-09T13:34:45Z","title":"Foundation Models for Semantic Novelty in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2211.04878","doi":"10.48550/arxiv.2211.04878","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.04878","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Foundation","venue":null,"work_id":"e280b419-a5dc-4496-bf21-e540f5b99c6e","year":2022},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2211.04878","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:2225ee7b6cd6969f09711712e1fe16ae8a4a4d236fbc1a5b1a5ada7575dd3c47","observation_id":"099b8cf7-d684-4de6-97dd-e85f8e3ac597","resolution":{"observed_at":"2026-07-02T02:06:27.283338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"HMMT february competition.https://www.hmmt.org/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:1bb565edc7b1ea76181dc320d63e3b1c804b9328bfd2657ab431fea1bdf832c7","observation_id":"a675e5bc-513f-407a-b0a4-be8e59e389c7","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:8911886fc1d6f5825e2dc64b11914116cbf5c8c9d59c94df0eb6d07f0c433ff6","observation_id":"8fee68db-00a0-4eed-a189-405a5936fdd5","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:09ea61be2f48335285f75ccbff286e0783dbf5910c996fa624b269d1f348e64d","observation_id":"5e4d5daa-c12f-4ff6-aaa4-0077cb4c55da","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-07-06T21:48:17.192656Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:afa60d5004cb066975d0a65e35a8cde697dc7746a479aea027027874a8f65c58","observation_id":"bc77d68d-c518-4809-9aa7-c3db5c2fec50","resolution":{"observed_at":"2026-07-02T02:06:27.261864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:55ba4adbc19eb84d1c530d0d6ceaac702d731144acb4cdf72eefe921c922f740","observation_id":"039a75b8-36bc-4c93-831c-4cd08087cc24","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2605.17333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17333","snapshot_observed_at":"2026-07-02T02:06:27.263175Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","venue":"cs.LG","work_id":"137670ce-94eb-460d-9e53-44352b1e3846","year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2605.17333","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:4f6334b3fda8e3f7f431b56123f3a6f0c646b2a5eea4b538389256f35331285b","observation_id":"ba8ccdcc-64d8-4c07-b1a1-472c9b830409","resolution":{"observed_at":"2026-07-02T02:06:27.264764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:93fc2311f461c203ff0d964c361215f1d2cfb307afb450034728d73e6025d1f1","observation_id":"267d07a5-f394-44c3-ac86-4d9bd858a288","resolution":{"observed_at":"2026-07-02T02:06:27.258704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.17305","last_updated":"2026-05-19T16:22:05Z","snapshot_observed_at":"2026-07-06T22:49:28.866886Z","submitted_at":"2026-03-18T03:00:42Z","title":"Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations","version":2},"cited_work":{"arxiv_id":"2603.17305","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.17305","snapshot_observed_at":"2026-07-02T02:06:27.266042Z","title":"Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations","venue":"cs.AI","work_id":"aa6cb8d7-a8d0-4810-b557-a3e7773a64bd","year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2603.17305","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:4e7a201c37053d0b34508cdf4c1893893218b0568f5953bc36dae04c539f2dd0","observation_id":"918abf7b-a54a-41c8-90bd-b7f399d6f19a","resolution":{"observed_at":"2026-07-02T02:06:27.267586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"AIME problems and solutions.https://maa.org/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:d37c7cdb11e93a41d242c7ee63e8c0388fba9e20abcb32f9c82e2aea4f12007f","observation_id":"793842e9-72be-44c2-a5f1-407c71554794","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"AMC 10/12 problems and solutions.https://maa.org/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:1ecb65216cc4422c0389b783b75c68ed31e10b2501036ca137724e4adbd78b5c","observation_id":"fac7aaa3-596d-4943-9d20-4c24dc7bff4e","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.383492Z","title":"Ngrpo: Negative-enhanced group relative policy optimization","venue":null,"work_id":"7cb63f10-8256-482c-8454-eebe075b7bfe","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:5b6c2ca4245e24f3256e0821611051b1fc66a01da917fdaf42962507cc201623","observation_id":"1fa4859f-0667-46c4-976d-96d8ae349115","resolution":{"observed_at":"2026-07-02T02:06:27.249056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:48c34bad5388486cf4f555699b8e5330d7df6c9c2373117942d1ec99272b7b33","observation_id":"24f2fb66-db74-4aa9-9cf4-8eeeeb01ba83","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Relational knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:fdbf6f66438b17fd5456b35df6e76b801c7c003edddfecc268a0bc387988d7a1","observation_id":"ff243a49-9c3d-412f-b6a0-82d1339436cf","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-04T17:04:00.611031Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":"2002.12292","doi":"10.48550/arxiv.2002.12292","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2002.12292 , year=","venue":null,"work_id":"2d43b8b8-ad54-4100-b5d2-5022a4d363a8","year":2002},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:d08921c98b998fccde7f23a56516f104f0cb9b9a2090764dfb5fd693e8fee21d","observation_id":"c74f7ca1-cf00-4cef-9c71-7b6cc29f80e6","resolution":{"observed_at":"2026-07-02T02:06:27.252391Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:f7ca7863d17f63137179bd6cec2e9ef7585276be0c48a9f05947a0a020f082ab","observation_id":"902a469f-cc30-484f-b1e0-a483f8043394","resolution":{"observed_at":"2026-07-02T02:06:27.268188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-07-06T22:12:21.217145Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:e6c976715cf6a5891e37fd7be956b56b3a31a33fcad909674008d3a62ebce369","observation_id":"459eabe6-40ea-4059-8e66-c0f25668fd16","resolution":{"observed_at":"2026-07-02T02:06:27.265290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.03772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.669302Z","title":"arXiv preprint arXiv:2508.03772 , year=","venue":null,"work_id":"5694fc9f-d85d-46e1-bbcf-199706efc784","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:44dd823fa16775b368071748759484b6509674c368f7a4223005425fafea8dcb","observation_id":"9704f948-8cf8-4ecc-bf8b-84d2697d3c85","resolution":{"observed_at":"2026-07-02T02:06:27.274217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05655","last_updated":"2026-04-07T09:55:50Z","snapshot_observed_at":"2026-08-04T02:17:34.830735Z","submitted_at":"2026-04-07T09:55:50Z","title":"LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals","version":1},"cited_work":{"arxiv_id":"2604.05655","doi":"10.48550/arxiv.2604.05655","metadata_source":"pith","pith_arxiv_id":"2604.05655","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals","venue":"cs.CL","work_id":"ee93f1ee-3fa1-49f2-85e1-7dd91345b3fd","year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2604.05655","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:154f47bc325dff43366ded6bbc801925e88d5bfd84e43f2dcbf958093e249d40","observation_id":"c235b19d-da3d-4111-83a3-00a5882c1576","resolution":{"observed_at":"2026-07-02T02:06:27.280205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.160747Z","title":"arXiv preprint arXiv:2511.00794 , year=","venue":null,"work_id":"3beb212f-d02b-4591-b3e3-dcebeb13a086","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:2035f24899850496fa87ce97ecbc0cca4ea7fd721622be0242cc8fce69ffb12f","observation_id":"3f29e08e-eefc-48db-9ad6-1781d50a28eb","resolution":{"observed_at":"2026-07-02T02:06:27.255280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10699","last_updated":"2022-01-24T19:12:34Z","snapshot_observed_at":"2026-07-06T08:31:42.308496Z","submitted_at":"2019-10-23T17:59:18Z","title":"Contrastive Representation Distillation","version":3},"cited_work":{"arxiv_id":"1910.10699","doi":"10.48550/arxiv.1910.10699","metadata_source":"pith","pith_arxiv_id":"1910.10699","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"URLhttps://arxiv.org/abs/1910.10699","venue":"cs.LG","work_id":"e0fc4057-ac4f-4c73-b04b-cc944c7701ad","year":2019},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/1910.10699","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:15d41b81acfd147971ec5676435cd75aeccf492071cdb7ef926ca19072b29051","observation_id":"17239b58-90e8-4605-80a4-fe3b2a9c386e","resolution":{"observed_at":"2026-07-02T02:06:27.234120Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:21.864262+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:21.864262+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13237","last_updated":"2024-07-18T07:47:51Z","snapshot_observed_at":"2026-07-06T18:48:16.629078Z","submitted_at":"2024-07-18T07:47:51Z","title":"LLM-Empowered State Representation for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2407.13237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13237","snapshot_observed_at":"2026-07-02T02:06:27.232020Z","title":"Llm- empowered state representation for reinforcement learning","venue":null,"work_id":"e7540014-0099-4d32-8142-6d663375500e","year":2024},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2407.13237","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:f08339bfed26fd8b4213cd5c87c98c4704a331c071d59344612c02e02b53d4f8","observation_id":"f4b768f0-1e6a-47a8-bdc8-7827472204c5","resolution":{"observed_at":"2026-07-02T02:06:27.233967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05543","last_updated":"2026-04-20T10:33:45Z","snapshot_observed_at":"2026-07-31T08:03:40.121303Z","submitted_at":"2026-01-09T05:51:56Z","title":"Closing the Modality Reasoning Gap for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2601.05543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05543","snapshot_observed_at":"2026-07-03T01:37:30.611503Z","title":"Closing the Modality Reasoning Gap for Speech Large Language Models","venue":"cs.CL","work_id":"952409f6-737a-4ba4-a626-821db6d76ff8","year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2601.05543","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:68c05baa9d984e8ef6eac2f104f81a158e07ac708626f4f03b8c1d6f1bc018a7","observation_id":"46e0c3db-2e8d-4f1c-83aa-0f4ed8e81d79","resolution":{"observed_at":"2026-07-02T02:06:27.220432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2605.17291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17291","snapshot_observed_at":"2026-07-02T02:06:27.221887Z","title":"Step-wise Rubric Rewards for LLM Reasoning","venue":"cs.LG","work_id":"9ed5903b-e8b8-4215-a6a9-ff12b9b7700b","year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2605.17291","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:c96e48361c0b4a2a866120981b4840874ecb0151e983b54e5315a0bde59158a2","observation_id":"fe052b4f-c69f-4a88-bf87-f8e3ce9a11ff","resolution":{"observed_at":"2026-07-02T02:06:27.223751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:a7d648aa0c900a9ea47c2e16f93b5875cd84cda1580f600dd2762e37d5aa805d","observation_id":"0d39a0e1-4727-46e6-8ce0-d9c40a002928","resolution":{"observed_at":"2026-07-02T02:06:27.226743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.Advancesin Neural Information Processing Systems, 37:62279–62309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:e0b05b3546afd64deab97ac97b3c7286b0da0299990fefeea6bb824248a53d28","observation_id":"89266322-9a9d-44f1-b6b3-a9eff2d05f24","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:13:21.565082Z","title":"Dapo: An open-source llm reinforcement learning system at scale.Advances in Neural Information Processing Systems, 38:113222–113244, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:9fe6877f6ffa9ccb8e46dd5e4e58582cdec8edcb1edfc6a3f61b3fbac734f424","observation_id":"1fe08952-f9bf-4b2c-b525-e7640571654f","resolution":{"observed_at":"2026-06-28T11:13:21.565082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-07-10T08:36:59.774135Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:14d3a5b102544b971723867eaae1bc5ea0a0f5dea0e760b24f0974fb882ab1c6","observation_id":"ba1d5106-159f-4966-ad2f-234fd759a8b2","resolution":{"observed_at":"2026-07-02T02:06:27.241288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:ecdc1b10f9095ba5b2c9f97141ec843136ca4d30c8a8345e8e88638e58c6805e","observation_id":"95de35a7-47dd-4860-bd5c-b3c0f5ed3b1f","resolution":{"observed_at":"2026-07-02T02:06:27.270607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.20673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.190550Z","title":"Geometric-mean policy optimization","venue":null,"work_id":"a9c27ea5-14a8-4719-a98d-c59a3a8c142a","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:18cdf99a539b1b6ea5f880cd6338f81160c296cbc53af63ce4f5d959730427eb","observation_id":"a1bfd013-df4d-4e38-ba6b-10f73cbb447e","resolution":{"observed_at":"2026-07-02T02:06:27.226675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-10T14:27:07.145784Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:a852aff9c741ea4af783471bcc752ef8c0674f6b246e3833465c984ee45f3e92","observation_id":"1bb72bb5-4672-4b52-818b-dabbb4a86bc7","resolution":{"observed_at":"2026-07-02T02:06:27.237419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":"2310.01405","doi":"10.1609/aaai.v36i9.21196","metadata_source":"pith","pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","venue":"cs.LG","work_id":"45b326e2-e962-41a5-a542-2559e103a19b","year":2023},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:556696ba35a4dbf4be14334ec43cfce93efd99e38b9a59dfb288a448e90c6d33","observation_id":"ccaefb89-7afd-4951-bd42-546bec4ef861","resolution":{"observed_at":"2026-07-02T02:06:27.198922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":12,"verified_exact":21,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2606.03234."}