{"as_of":"2026-08-14T17:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f92f27786f2e9f57006ae7f2dcc08bc2f9e331e1b3cf340fb0c4b82cf7b048ff","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:11:38.289892Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09123/citation-record","integrity":"/paper/2608.09123/integrity","json":"/paper/2608.09123/citation-record.json","paper":"/paper/2608.09123"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-11T23:11:38.073068Z","title":"arXiv preprint arXiv:2507.17746 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.073068Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:2b4167a3fa5492f91d10d93200ad77dc8face6d9c9ead13979919e0fd55e8a51","observation_id":"4e9b37a6-534e-43c0-a234-3ec5e4e92e13","resolution":{"observed_at":"2026-08-11T23:11:38.073068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-12T11:04:06.923686Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-11T23:11:38.080415Z","title":"arXiv preprint arXiv:2604.13016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.080415Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:765fa4be169651ea35df93c254e208d6767f3af74f9558f9795cfc4fa31b234a","observation_id":"2889924e-d62e-4057-9eb2-c97356e32dfe","resolution":{"observed_at":"2026-08-11T23:11:38.080415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.085238Z","title":"arXiv preprint arXiv:2511.12344 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.085238Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:c03190557bee3540683e52a5dbb52059d164ce86326170a88139d7529117b020","observation_id":"0a6f03e2-8876-42b4-b54c-3710f18f9f07","resolution":{"observed_at":"2026-08-11T23:11:38.085238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T23:11:38.089807Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.089807Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:1170aea29492557fba0d64b68006fe7412dac39813cb06d51f12284bdc037bb7","observation_id":"e25f382d-7726-4dcd-8f98-3f52600eb963","resolution":{"observed_at":"2026-08-11T23:11:38.089807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.916816Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"7f946e71-2c18-42d5-aa28-b7c11976d35e","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.095300Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:a6b911f42ddb6b4c5864227a5d7e16a265cfc38994ab9aa4345a89d342c985a2","observation_id":"72b2f941-3755-4bb3-a9a8-6261975bf125","resolution":{"observed_at":"2026-08-11T23:11:38.921467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-11T23:11:38.100222Z","title":"arXiv preprint arXiv:2601.18734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.100222Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:f863d2ba6a28293d5b06f730154743c2e78741d98569727cff901ee012d974c6","observation_id":"08cc7842-2721-4c75-a21f-adc11d070f92","resolution":{"observed_at":"2026-08-11T23:11:38.100222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.105966Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.105966Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:b0c78707f8adfed94341e441ba2b2c86849e052bb4edf0625468b9496edb3357","observation_id":"0b4fe6c1-b781-4a5f-a769-ec0739941a65","resolution":{"observed_at":"2026-08-11T23:11:38.105966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-11T23:11:38.110587Z","title":"arXiv preprint arXiv:2506.03106 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.110587Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:87776ef4f183934c80b5bad45665d8917548744fc2ed2377a76caba736da3bf5","observation_id":"fe2f8e82-8e4d-4241-9d0c-09b7c8812357","resolution":{"observed_at":"2026-08-11T23:11:38.110587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12507","last_updated":"2026-06-10T17:53:19Z","snapshot_observed_at":"2026-08-12T17:05:26.243616Z","submitted_at":"2026-06-10T17:53:19Z","title":"Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers","version":1},"cited_work":{"arxiv_id":"2606.12507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.12507","snapshot_observed_at":"2026-08-11T23:11:38.562320Z","title":"Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers","venue":"cs.LG","work_id":"b0826660-be20-42f3-8e1f-3f5d913e087d","year":2026},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.115837Z"},"links":{"cited_paper":"/paper/2606.12507","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:83b4bd39010d57112f6195807771f15ada76fa91081a7b3369faee4ffcf66900","observation_id":"6d5fcef0-a15f-44e5-8771-6266d75b7602","resolution":{"observed_at":"2026-08-11T23:11:38.568943Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-12T19:55:07.549574Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-11T23:11:38.121096Z","title":"arXiv preprint arXiv:2508.16949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.121096Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:1c20c56939169e71483f7c605e95034e4d74e3ccdbd006f2d8b95a625ccbfb69","observation_id":"ae9b5fbc-19c2-4f56-a2a5-01ccf9ddf461","resolution":{"observed_at":"2026-08-11T23:11:38.121096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T23:11:38.126401Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.126401Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:c0f3138872d8b9df736fd22e2d3f6ed435fe9689ee32b642cb8b6ae61d29fb20","observation_id":"0bed4ef3-626f-49c7-a965-fa73d374b097","resolution":{"observed_at":"2026-08-11T23:11:38.126401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T23:11:38.132503Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.132503Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:e89d70d7633ff6edbbb462408d2735efbda35a7e4164190852b084932497a757","observation_id":"84dfdcd7-c8fb-47c0-b765-55322c1a2eed","resolution":{"observed_at":"2026-08-11T23:11:38.132503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.891148Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"df42e080-a53a-44ec-8e43-266362c01e53","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.137627Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:54aa198aa0f12dbb2ba6bbc4b9e21e5e84fc7fee0b919df6f96ba3311929b3ab","observation_id":"28322207-e553-462d-91b6-485a2295f2c9","resolution":{"observed_at":"2026-08-11T23:11:38.897530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-11T23:11:38.142183Z","title":"arXiv preprint arXiv:2505.08775 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.142183Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:70533390a1e2cfcf64a79f7f4599d7b8358904217fa5d1dd18b0c1acfb6aa5ee","observation_id":"3bdef624-99cb-46d0-9025-8d16377d591f","resolution":{"observed_at":"2026-08-11T23:11:38.142183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04078","last_updated":"2025-08-31T14:41:06Z","snapshot_observed_at":"2026-08-13T18:53:17.134119Z","submitted_at":"2025-06-04T15:43:14Z","title":"LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04078","snapshot_observed_at":"2026-08-11T23:11:38.148136Z","title":"arXiv preprint arXiv:2506.04078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.148136Z"},"links":{"cited_paper":"/paper/2506.04078","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:271d4fec4008cef4d488982820616453536af4f5281c420cb9d601c159428ed1","observation_id":"64de9da0-61a2-4473-8bb0-e97d61f24011","resolution":{"observed_at":"2026-08-11T23:11:38.148136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.153305Z","title":"Applied Sciences , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.153305Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:0e95c2d8af072e4060f28a94735b02bff66b888c2b8393dc9d15c12a5ef5b022","observation_id":"83fa3cc0-f6ed-4374-a9c0-f610deb970b2","resolution":{"observed_at":"2026-08-11T23:11:38.153305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-11T23:11:38.158924Z","title":"arXiv preprint arXiv:2406.11939 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.158924Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:c6b60a1e0cc4cfe9a6086cca52f1e2fec86c30cd3fe66ef6329b3bbd0f20fbf8","observation_id":"0b5f20ae-92ad-4554-980c-951c20179e7e","resolution":{"observed_at":"2026-08-11T23:11:38.158924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.864403Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"1af51798-460f-4d60-8f80-8ff291ca7fb3","year":2026},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.164677Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:e7f661966ddaf2940bfc45656bb974fe681981cbcc57649a7f36f8dd300fc4ad","observation_id":"99bee403-91c7-4697-b25d-9935a7208b85","resolution":{"observed_at":"2026-08-11T23:11:38.871668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T23:11:38.170181Z","title":"arXiv preprint arXiv:2311.12022 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.170181Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:6c94d10efec4666fbbf43384baec4c28e6d5e93eed24be0e384fe54994997e40","observation_id":"fc121aa3-0bed-4f75-af57-979f14a1cf01","resolution":{"observed_at":"2026-08-11T23:11:38.170181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.175090Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.175090Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:c3b5bc2d4ee018a4be26b4d5310738653bfbeee77ea29256954c52d1ff8385d0","observation_id":"5cef6ef6-5384-43ba-a09c-4d0c8b7a577e","resolution":{"observed_at":"2026-08-11T23:11:38.175090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.180318Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.180318Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:c088f40029ceed4bda658311302cdb8ac64a54dbe23518c379d694a236a63447","observation_id":"3de14e40-347c-4d9a-9978-5e867bbe0913","resolution":{"observed_at":"2026-08-11T23:11:38.180318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21801","last_updated":"2025-07-18T08:20:23Z","snapshot_observed_at":"2026-08-02T11:46:58.603316Z","submitted_at":"2025-04-30T16:57:48Z","title":"DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21801","snapshot_observed_at":"2026-08-11T23:11:38.186179Z","title":"arXiv preprint arXiv:2504.21801 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.186179Z"},"links":{"cited_paper":"/paper/2504.21801","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:233e85e0f7ed7748ae64645812cd9fe4cbce1541c477b0c76bd9bd4d1e97cb9a","observation_id":"04377bda-206d-4a30-8fd3-fabdb4c3d6b6","resolution":{"observed_at":"2026-08-11T23:11:38.186179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23726","last_updated":"2025-08-01T03:36:47Z","snapshot_observed_at":"2026-08-07T12:23:31.292936Z","submitted_at":"2025-07-31T17:00:30Z","title":"Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23726","snapshot_observed_at":"2026-08-11T23:11:38.192972Z","title":"arXiv preprint arXiv:2507.23726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.192972Z"},"links":{"cited_paper":"/paper/2507.23726","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:58dafe0c854e19e5cf4e051d1dd6dbf69022cdb189a60655543f07451989c665","observation_id":"e2b52015-9197-4f6a-948a-1c52fc66f927","resolution":{"observed_at":"2026-08-11T23:11:38.192972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00729","last_updated":"2026-02-28T16:25:04Z","snapshot_observed_at":"2026-08-14T11:50:51.747505Z","submitted_at":"2026-02-28T16:25:04Z","title":"Qwen3-Coder-Next Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00729","snapshot_observed_at":"2026-08-11T23:11:38.197504Z","title":"arXiv preprint arXiv:2603.00729 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.197504Z"},"links":{"cited_paper":"/paper/2603.00729","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:301437d888e9230419449efed321124ad95246b05132112c9e3794cf092f4dab","observation_id":"7258defc-00ed-4389-b722-b44d0ab08d68","resolution":{"observed_at":"2026-08-11T23:11:38.197504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.204640Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.204640Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:a0019d25bbc726eb753764d6ba5ff1ad2b603f5dd07270750cebbdc372838677","observation_id":"aee86933-812c-4885-8a8b-4da80ce8a7f7","resolution":{"observed_at":"2026-08-11T23:11:38.204640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.824308Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":"e6b84f2a-2024-4217-a51a-2eff894ee17a","year":2023},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.210105Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:73a8e73dedda0eb918aa2d43c215ed9b3f29295575652518cf90f9e510f1e020","observation_id":"83a8fd66-4828-47ab-8e32-3506cff0841e","resolution":{"observed_at":"2026-08-11T23:11:38.828544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00008","last_updated":"2025-02-13T12:10:33Z","snapshot_observed_at":"2026-08-13T12:15:24.652439Z","submitted_at":"2023-03-27T18:00:01Z","title":"On the Creativity of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00008","snapshot_observed_at":"2026-08-11T23:11:38.214884Z","title":"arXiv preprint arXiv:2304.00008 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.214884Z"},"links":{"cited_paper":"/paper/2304.00008","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:e9e5056b3bec27e1f9994d3d8b179c37b8fc1efa4e20ee3a62487cfbe7a6fa04","observation_id":"8e66481c-668f-48c6-b8d5-3e6499a81165","resolution":{"observed_at":"2026-08-11T23:11:38.214884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09838","last_updated":"2025-02-21T17:39:29Z","snapshot_observed_at":"2026-08-14T04:57:56.034309Z","submitted_at":"2025-02-14T00:42:36Z","title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09838","snapshot_observed_at":"2026-08-11T23:11:38.219627Z","title":"arXiv preprint arXiv:2502.09838 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.219627Z"},"links":{"cited_paper":"/paper/2502.09838","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:f1b6ab870d1445e76aa9821ad8e6c93b429969c8047cd30e8be5d5f40707b1be","observation_id":"1c96373c-fbe9-4cd6-a317-02282b3da307","resolution":{"observed_at":"2026-08-11T23:11:38.219627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.810745Z","title":"Nature , volume=","venue":null,"work_id":"07cbcec2-6f89-4c0c-9a77-47c2e4ddd7e5","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.225075Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:77eadafd6dfe9d872ab97dd06b5b1e57280e0005e80c00abc4748d8523be3eec","observation_id":"636e7c9e-4193-418b-8f5e-8bee23424b18","resolution":{"observed_at":"2026-08-11T23:11:38.815571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.229833Z","title":"Nature medicine , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.229833Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:66dfcd72b709d37c0f33b6e88d00ed3617a199eb9940d9e1c6a96608b2a59214","observation_id":"91db8d45-85b1-4afa-a212-92576f8c04a9","resolution":{"observed_at":"2026-08-11T23:11:38.229833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09939","last_updated":"2024-07-10T01:25:50Z","snapshot_observed_at":"2026-08-13T00:05:59.806923Z","submitted_at":"2024-05-16T09:42:37Z","title":"SciQAG: A Framework for Auto-Generated Science Question Answering Dataset with Fine-grained Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09939","snapshot_observed_at":"2026-08-11T23:11:38.236628Z","title":"arXiv preprint arXiv:2405.09939 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.236628Z"},"links":{"cited_paper":"/paper/2405.09939","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:f5b2abfc0de379f43868eea0a26f28e4aa61da22da099fe391c9749a3d73eb6c","observation_id":"241a1351-f8bc-4b7d-aa6a-a1e5294f9b31","resolution":{"observed_at":"2026-08-11T23:11:38.236628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.783142Z","title":"Proceedings of the 34th ACM International Conference on Information and Knowledge Management , pages=","venue":null,"work_id":"22e43d5c-e837-4dbc-a284-fdb578d9370a","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.243254Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:5205e5fbfd69c619778c2abcf2155d891ed9c9ec1a185c9d3d4716b6af38af0b","observation_id":"58c720c6-929e-4461-896f-464740834da5","resolution":{"observed_at":"2026-08-11T23:11:38.787405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.767410Z","title":"Proceedings of the 58th annual meeting of the association for computational linguistics: system demonstrations , pages=","venue":null,"work_id":"dc2a077e-ad8f-472c-a2fc-5a4386808229","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.249500Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:cd092e27327d6d881afba638d8e163da0e9b14a297e575d13096debd216023c3","observation_id":"6adbf349-02cd-4418-84e7-31ccbcb8747b","resolution":{"observed_at":"2026-08-11T23:11:38.773222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.752522Z","title":"Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics: Main Volume , pages=","venue":null,"work_id":"8f061aaa-104e-42be-a01f-b939c99feb75","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.259339Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:90a9f9b0274f885c11731a3ff7cb1316bc896a1f083197076dd085870dba5d08","observation_id":"c57b886f-9d57-441b-9441-3167ad8120cf","resolution":{"observed_at":"2026-08-11T23:11:38.758328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-11T23:11:38.266959Z","title":"arXiv preprint arXiv:2201.08239 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.266959Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:400b325e407c0bca1eec2a185543d579a3f3a206617a157be06076d6690740f8","observation_id":"cb1e5e7e-dcdf-4ff3-86db-55733153b85e","resolution":{"observed_at":"2026-08-11T23:11:38.266959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.738416Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5965a899-fd1f-480e-92ac-dc72898f94a0","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.273675Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:5a46e180b3975cd7247b39a469ee884827d1403299caa68b97242192e2d0599a","observation_id":"fdf34d31-bf96-4e2e-a42f-05c2132e88ae","resolution":{"observed_at":"2026-08-11T23:11:38.742637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-11T23:11:38.279670Z","title":"arXiv preprint arXiv:2601.20802 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.279670Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:a6d0d9bca1a61e12a94e34db51d286eb80a0e29c0a8582eef1164ff55968ff60","observation_id":"ff5e8cbd-2f24-4256-ab36-2b320446ab19","resolution":{"observed_at":"2026-08-11T23:11:38.279670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-08-13T01:43:27.853141Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-08-11T23:11:38.284922Z","title":"arXiv preprint arXiv:2605.28014 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.284922Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:9553986526f319b3d30dcd5666542992db33a03b398a45482830944c06da5e68","observation_id":"7e05d968-6086-4871-b0ca-baa86e11f4bd","resolution":{"observed_at":"2026-08-11T23:11:38.284922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.725651Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"2df1bba7-87c2-4766-b07e-702b9e4a94c7","year":2026},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.289892Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:aeb7d30362519f21335cd1a420107499396f4d90f9ac2d1ec42710adced7cfd3","observation_id":"37745c5f-89e8-4a9d-a9f0-a24d32e33a31","resolution":{"observed_at":"2026-08-11T23:11:38.729881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2608.09123."}