{"as_of":"2026-08-03T10:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86eb90d87a4124a28863495613285058d2bd2f2b32fb65b761c6f6b8121731df","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T17:08:23.269275Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:03:42.266254Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-12T07:51:38.881425Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"cited_work":{"arxiv_id":"2603.15646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.15646","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","venue":"cs.LG","work_id":"173505d8-1e1d-445d-b12b-a6a9ff6dc659","year":2026},"citing_paper":{"arxiv_id":"2605.08378","last_updated":"2026-05-08T18:36:25Z","snapshot_observed_at":"2026-08-02T18:04:56.183678Z","submitted_at":"2026-05-08T18:36:25Z","title":"Reinforcement Learning for Scalable and Trustworthy Intelligent Systems","version":1},"reference_index":164,"source":"pdf_text","source_observed_at":"2026-05-12T01:47:40.772146Z"},"links":{"cited_paper":"/paper/2603.15646","citing_paper":"/paper/2605.08378"},"observation_digest":"sha256:eb5d5b2c77b9f7ead06063df78a22474c25dd13e7edc02df801f4865d322c6bc","observation_id":"01682382-2014-48d5-872e-b6959ccacae6","resolution":{"observed_at":"2026-05-12T07:51:38.936160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15646","snapshot_observed_at":"2026-08-01T15:03:42.266254Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21635","last_updated":"2026-07-20T23:14:36Z","snapshot_observed_at":"2026-08-01T15:03:38.976549Z","submitted_at":"2026-07-20T23:14:36Z","title":"Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T15:03:42.266254Z"},"links":{"cited_paper":"/paper/2603.15646","citing_paper":"/paper/2607.21635"},"observation_digest":"sha256:21e3cd46cac57f4a4d780e63e78ab645d2db2d375780aef1dfc0ce8b0e47eb58","observation_id":"623215f7-1583-430c-8a30-443982b723de","resolution":{"observed_at":"2026-08-01T15:03:42.266254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.15646/citation-record","integrity":"/paper/2603.15646/integrity","json":"/paper/2603.15646/citation-record.json","paper":"/paper/2603.15646"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H., Gendler, A., Baruch, E","venue":null,"work_id":"e623855d-6818-4e27-84c8-4449d7cb2a47","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:ea52009b93922a5e8a490f672e2c8ae5ac4dc78e86c51d846a9d3ce3eb032d2b","observation_id":"f7ed8e7f-0c5a-4c00-9a81-8acffdac8a78","resolution":{"observed_at":"2026-05-15T17:10:11.210472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-07-10T18:57:31.585722Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:b051aa0f665470d731ae208337f56b191437864b80d60eb662c2d390c06e9cba","observation_id":"bf8328d8-4c95-4557-a204-05683fd2b2ec","resolution":{"observed_at":"2026-05-15T17:10:10.350720Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-11T02:47:49.311954Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:8f58e47a01dab095847cdcf3cf24f2fae496409cf931854abbf639ca51fa7786","observation_id":"02e6903c-9be5-42d8-bf6e-aef97cd6cd38","resolution":{"observed_at":"2026-05-15T17:10:10.332916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06672","last_updated":"2026-05-25T01:59:00Z","snapshot_observed_at":"2026-07-06T22:31:58.848080Z","submitted_at":"2025-10-08T05:53:56Z","title":"XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation","version":3},"cited_work":{"arxiv_id":"2510.06672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06672","snapshot_observed_at":"2026-06-29T00:02:49.998505Z","title":"Xrpo: Pushing the limits of grpo with targeted exploration and exploitation.arXiv preprint arXiv:2510.06672","venue":"cs.LG","work_id":"c1e825b8-b415-4c32-a6a6-b434dbb9a276","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2510.06672","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:8f2be421ec8d1df3c4da01deffdf5574b3f4824513846a8fdbd0535c3119e95c","observation_id":"1bacc138-fa68-4527-b4fe-2a77ad2b0d19","resolution":{"observed_at":"2026-05-26T03:04:06.160463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20357","doi":"10.48550/arxiv.2509.20357","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Language models that think, chat better","venue":null,"work_id":"c94bf5a8-75d9-410d-a8ec-bceb0a99dffe","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:90f37fb8467108b6a5abf1f234f215c71d073dbd5b7e024d35a07dce53af0722","observation_id":"67c5f086-2392-481f-9936-c73202b9170d","resolution":{"observed_at":"2026-05-15T17:10:10.403000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:59d15d33d2d7c77e32ff8154e8763aacf2f0b415e0c1d1f96ef4203a1e8dc70f","observation_id":"5d59b23f-9125-4152-91fd-b49ca58de998","resolution":{"observed_at":"2026-05-15T17:10:10.378588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10507","doi":"10.48550/arxiv.2511.10507","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2511.10507 , year=","venue":null,"work_id":"9856b82b-89d8-4de5-95b0-b178d14f782f","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:3e614e2b428af3a0f14c6db74a2088307940ec9ac327bb64672d3e941887a9a0","observation_id":"babd34df-a8b7-480c-8daf-1b43780aa7f0","resolution":{"observed_at":"2026-05-15T17:10:10.357083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-07-06T22:14:21.107961Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reinforcement learning with rubric anchors","venue":null,"work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:8d9bb77f71c847dc97f1d9c880c1827e7fa41462e532148a69e715ab2e319b86","observation_id":"e85495b3-c760-4a36-93ab-334b15bc8a38","resolution":{"observed_at":"2026-05-15T17:10:10.378397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21183","last_updated":"2026-05-07T18:05:39Z","snapshot_observed_at":"2026-07-06T22:04:06.813418Z","submitted_at":"2025-07-27T05:26:50Z","title":"MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge","version":5},"cited_work":{"arxiv_id":"2507.21183","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21183","snapshot_observed_at":"2026-06-30T11:14:37.529210Z","title":"MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge","venue":"cs.LG","work_id":"74c37b82-7066-41dd-910a-69b3b2779545","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2507.21183","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:45de6b8f746b51b2f6dd53e2cabeedad2f5afe9605d9c75fcf60452944a06a8e","observation_id":"926a2f97-4b4c-4901-b841-6f6c88568dad","resolution":{"observed_at":"2026-05-15T17:10:10.383743Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01915","last_updated":"2025-07-02T17:25:26Z","snapshot_observed_at":"2026-07-06T21:51:14.737439Z","submitted_at":"2025-07-02T17:25:26Z","title":"Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.01915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01915","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient-adaptive policy optimization: Towards multi-objective alignment of large language models","venue":null,"work_id":"42e6566f-897a-4cde-acf8-643a2b900b3a","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2507.01915","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:725b747a6c2d4a04dbb481ceec24c99a4d0007d1228a79ba6cd1645d5d0f010e","observation_id":"743c52f8-3add-4133-91d6-b5d6be436fbe","resolution":{"observed_at":"2026-05-15T17:10:10.403325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.11452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:59:34.026636Z","title":"Learning to optimize multi-objective alignment through dynamic reward weighting","venue":null,"work_id":"4607a4dc-f26e-41b2-966e-568ce2a5dff4","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:2f2f2514241162351c38a0d096a73457775c6f03e4060ec8c9bbb8324bfa16c4","observation_id":"b8c6df27-566c-470d-9452-5dd60f4f12a1","resolution":{"observed_at":"2026-05-15T17:10:10.396976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:49:44.762854Z","title":"Online rubrics elicitation from pairwise comparisons","venue":null,"work_id":"997bca21-08ad-4445-841f-1609abeb4657","year":2019},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:d7d4ec6d1df57320fb4b43edfaf2b79b63fd69f1033dc0ad441ea28aa3b8c59b","observation_id":"64ad7a06-22b8-4fe7-8cd6-be8316a5cda4","resolution":{"observed_at":"2026-05-15T17:10:10.372183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:43d0d7e3ed759d5ae8e9ed91fb56975bc0d013ad8894e2dec9c4287559e3b187","observation_id":"230ddb86-54b7-48d0-85af-f7e6af4abd7e","resolution":{"observed_at":"2026-05-15T17:10:10.339593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:8b3c729d65244292b1e98095121cdfa41e3693c45e9adaf369695ccca106e3f5","observation_id":"4d72c8f2-1d8b-486d-aed7-81956b721a65","resolution":{"observed_at":"2026-05-20T00:00:28.487879Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:b4532daad2e1f092493a66cd362aa62b591e477e8dcf83d4a054595fe56116af","observation_id":"b353b112-8ab4-4c92-b29c-0352a7f7fd9f","resolution":{"observed_at":"2026-05-15T17:10:10.373798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:f00846b5bb0c72f70917865b921ba444e906daf4b40c7d66b8a41799d4364473","observation_id":"98fc3c8c-3610-4314-9f0a-407b49f7958d","resolution":{"observed_at":"2026-05-15T17:10:10.390724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.13607","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:51.113523Z","title":"Nemotron-cascade: Scaling cascaded reinforcement learning for general-purpose reasoning models","venue":null,"work_id":"173f9208-0d90-4609-b922-87dc83059cc1","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:6bf54650cf46b0fc278641a3b4cdb7662889167aaec739de8e23f9c7dc3fba0e","observation_id":"1544c5fe-57fb-47d7-8d66-bcc4ca1ba7ba","resolution":{"observed_at":"2026-05-15T17:10:10.384722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:38.647682Z","title":"arXiv preprint arXiv:2602.01511 , year=","venue":null,"work_id":"e335e839-8b57-4dd7-9e80-eea9b45fff33","year":2026},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:b2a0ae26b0cabcc6c0f59a08faf614283f35f1cf5038110bf30b1b1e0b1fbeba","observation_id":"58184558-409e-4387-8175-a31b123cae3c","resolution":{"observed_at":"2026-05-15T17:10:10.351260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:c042521a927e92bfa46b681245d560d02d0796cb4b74b65007256482a86eb2cf","observation_id":"03f65816-e7db-4a58-b780-04d4effd86f9","resolution":{"observed_at":"2026-05-15T17:10:10.389425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.641795Z","title":"Does this image satisfy this rule?","venue":null,"work_id":"29a787cd-2797-4d47-96a6-fdcc322ee8b5","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:3e11ce7b2450bb403be276165c26058349f7a4985b9dd693e91e90ff423ca48a","observation_id":"df6a2493-f2bf-462a-84cb-ac6ed9e751ae","resolution":{"observed_at":"2026-05-15T17:10:10.409449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-10T14:27:07.145784Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:87484c08ca0cfd8a523a98a9e61975cd555a6e699ddbd3c737bcaeffe2ef4b9b","observation_id":"a8683238-ad7e-4b0a-aac5-b3bfd90353d4","resolution":{"observed_at":"2026-05-15T17:10:10.360727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.16949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.633021Z","title":"Breaking the exploration bottleneck: Rubric-scaffolded reinforcement learning for general llm reasoning.arXiv preprint arXiv:2508.16949","venue":null,"work_id":"ca755e28-afae-49ff-addc-7f3dbaca0baa","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:e043d750170cf3fc0edffe3a76c73ac14d99f4c97bd3c54f3eefe59c097d89a8","observation_id":"f49e56ad-0276-47f8-ac17-be9fbaa1550f","resolution":{"observed_at":"2026-05-15T17:10:10.314742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I’m an emergency medicine physician","venue":null,"work_id":"433f03ad-612e-45f1-9904-3e68ae7555ad","year":2023},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:7a4a03654dcff3e47d0d851579164dc8e1011bd32cccc52788a4882fed004839","observation_id":"d3a505f3-a108-4713-8047-b886cb783476","resolution":{"observed_at":"2026-05-15T17:10:11.215521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"accuracy","venue":null,"work_id":"96dfb3bf-d4b4-4aec-a064-6ec1ae323252","year":2023},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:d13ede22bcf44be125a38175156d588b72768f53f65126dff34420f4e23513d2","observation_id":"86af8d85-5403-4cc1-8bdd-d5597f3e90b2","resolution":{"observed_at":"2026-05-15T17:10:11.209097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"‘list [ { “criterion","venue":null,"work_id":"97d7a491-7d57-4f5a-8d3f-0ac0017c9fdf","year":2023},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:9800af0695610369790fe8480a4ae901a8b4391b9b7d9baf34e95eb2af07565d","observation_id":"c880ebe9-ddf9-44eb-a386-db0d3aaeffc7","resolution":{"observed_at":"2026-05-15T17:10:11.208091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-3.1-8B-Instruct starts at 0.34 and achieves 0.70, while Qwen3-8B starts at a higher score0.58and achieves0.76","venue":null,"work_id":"144a09bf-b01e-4f38-93cd-d865ecf6aeae","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:4836023eea9636a52d7d9e09533d95a930025d1bc85581e22066234218c46dec","observation_id":"858c46ae-06b5-4637-ae2b-1cad7bfae204","resolution":{"observed_at":"2026-05-15T17:10:11.213055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In ARL, we use the fixed meta-class Order 0: [completeness, accuracy, instruction following, context awareness, communication quality]","venue":null,"work_id":"469c70be-4fb3-4aa0-a189-140a82f9eb8b","year":2094},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:31a02198b749b7e593355a5eb397052b571bfa8a0d7ad8381dca8d23a653a225","observation_id":"58b581e5-cd56-4160-a5e6-b9b8e55bdbfe","resolution":{"observed_at":"2026-05-15T17:10:11.204202Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The maximum response length is set to 2048, and the temperature in LLM sampling is set to 1.0 in the training process","venue":null,"work_id":"907aa648-d2e5-4fcd-8206-2fb8f2ea75ce","year":2048},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:7110bf1698107f05ef3ddecadb5ed825fe5286d622c7de83ec88b4d1d4aaaac3","observation_id":"28e83434-7346-41a8-b8c9-87c6ed66c940","resolution":{"observed_at":"2026-05-15T17:10:11.211669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":17,"verified_fuzzy":6},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 2 inbound Pith citation observations for arXiv:2603.15646."}