{"as_of":"2026-08-04T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80d7989469f8074c620b4c3ae594dbb0f169b51324f2afe0d407ca0ddd98ced5","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T13:30:36.529139Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:47:25.697650Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T02:06:27.221887Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17291","snapshot_observed_at":"2026-08-02T21:50:59.519853Z","title":"Step- wise rubric rewards for llm reasoning.arXiv preprint arXiv:2605.17291,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06626","last_updated":"2026-05-24T09:37:35Z","snapshot_observed_at":"2026-08-02T21:50:53.342047Z","submitted_at":"2026-02-22T06:09:57Z","title":"Grouter: Decoupling Routing from Representation for Accelerated MoE Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:50:59.519853Z"},"links":{"cited_paper":"/paper/2605.17291","citing_paper":"/paper/2603.06626"},"observation_digest":"sha256:bb1e30fd31c19373e527615338222e6b8cc48425ace1e4eee5012592406e9ee8","observation_id":"da969cc1-711a-4bd4-a8d6-6d1960a1a9ff","resolution":{"observed_at":"2026-08-02T21:50:59.519853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2605.17291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17291","snapshot_observed_at":"2026-07-02T02:06:27.221887Z","title":"Step-wise Rubric Rewards for LLM Reasoning","venue":"cs.LG","work_id":"9ed5903b-e8b8-4215-a6a9-ff12b9b7700b","year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2605.17291","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:c96e48361c0b4a2a866120981b4840874ecb0151e983b54e5315a0bde59158a2","observation_id":"fe052b4f-c69f-4a88-bf87-f8e3ce9a11ff","resolution":{"observed_at":"2026-07-02T02:06:27.223751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17291","snapshot_observed_at":"2026-07-30T18:33:28.644437Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-04T15:16:40.556087Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-30T18:33:28.644437Z"},"links":{"cited_paper":"/paper/2605.17291","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:a252533557797759bae1980595d0de30feb027602fa99d61f39f6bce863072f6","observation_id":"6086d151-76e3-40ac-9188-d1c93b6227bd","resolution":{"observed_at":"2026-07-30T18:33:28.644437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17291","snapshot_observed_at":"2026-08-03T01:47:25.697650Z","title":"Step-wise Rubric Rewards for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-04T15:16:40.556087Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T01:47:25.697650Z"},"links":{"cited_paper":"/paper/2605.17291","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:6d6c5c40ce637fa7bccb6837202c97003457ff5827fadd08d9d458da3e8c73b0","observation_id":"acb8ae21-3960-487b-9a56-fbcdf4db8c5b","resolution":{"observed_at":"2026-08-03T01:47:25.697650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17291/citation-record","integrity":"/paper/2605.17291/integrity","json":"/paper/2605.17291/citation-record.json","paper":"/paper/2605.17291"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward and guidance through rubrics: Promoting exploration to improve multi-domain reasoning","venue":null,"work_id":"c2c9785e-f179-446d-9c06-c9b4de2917ef","year":2025},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:49e5725f40f2169f98f82700fc6a471d784ff7bcbeae8744ab10d2337881cd96","observation_id":"4330624b-45a4-409d-94c0-2510dc66117a","resolution":{"observed_at":"2026-05-20T13:33:19.249714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:4497c50daed27f160e6fc4f6945920a9f13728ff5b8fc06d7055aec42b9e2551","observation_id":"5851d4f6-769c-4b6f-92e9-0d896e34dc6a","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.Nature, 645: 633–638","venue":null,"work_id":"89634292-e3bc-48cf-984a-a5352fb6c081","year":2025},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:c993031b28939d7358c1f2fbc8ead370070de651b8d46af1dc9b2bfe0d01ce9b","observation_id":"658ac151-cdb4-4ef2-85af-75943987ac57","resolution":{"observed_at":"2026-05-20T13:33:29.986902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05665","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:36:56.981467Z","title":"Interleaved latent visual reasoning with selective perceptual modeling","venue":null,"work_id":"d12dcb47-4b0a-42df-944f-f13015a4752d","year":2025},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:88c15b24d5ad2f468b078ea83370b6f2ba0f764f11bb075e6bda91af3f349986","observation_id":"8bf5e72e-4470-4818-a7ab-bd1385747faa","resolution":{"observed_at":"2026-05-20T13:33:19.231448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:48aaa451d9e816027da7e9ad5eef3238a7e9558dc46e91d08e69c60689eb84d1","observation_id":"5efb6a2e-21fc-4d18-818a-62aa3faac16c","resolution":{"observed_at":"2026-05-20T13:33:19.243229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM-Rubric: A multidi- mensional, calibrated approach to automated evaluation of natural language texts","venue":null,"work_id":"025b0bbc-9058-4a68-b4c5-d680c3e4f5cb","year":2024},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:01d9ab6c343eccd27a63df1af4d3bf11f1b66f219f034d84c68885faf7c7045a","observation_id":"719a3b04-0f42-47f0-a0ac-0ff6396aa84f","resolution":{"observed_at":"2026-05-20T13:33:30.012270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OlympiadBench: A challenging benchmark for promoting AGI with olympiad- level bilingual multimodal scientific problems","venue":null,"work_id":"c1002f76-50f0-4199-9bdb-e2e03ae242f3","year":2024},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:3a72bd6172e1947e42800615b844c0bbb88c82695bf6c8e9f6c341d1fd742057","observation_id":"e4e1609c-2cea-49f4-951a-18b01022a77a","resolution":{"observed_at":"2026-05-20T13:33:30.010078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the MATH dataset.Advancesin Neural Information Processing Systems, 34:7294–7305","venue":null,"work_id":"e09608af-b90a-48d6-a18e-4c646990319b","year":2021},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:a4a11b5b9d974e44820548891afb00036bb4677ea5967be71d54e1675653928a","observation_id":"9e89cd13-aaa9-4a83-a482-c9330a3f3409","resolution":{"observed_at":"2026-05-20T13:33:29.998141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models","venue":null,"work_id":"3c713f10-7c18-490f-b308-622680c30738","year":2024},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:07e17a9e64bc108021ba8ed2143b520476d69b0135ded8dc1b7da5de9b977f95","observation_id":"910cc2d2-cada-4c09-a841-2dc0bdd52f99","resolution":{"observed_at":"2026-05-20T13:33:30.000034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"16dbf7f6-9efb-4aed-a9c9-ef852c6c3c4b","year":2022},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:b52875a1c24b4fff28f89eb5ad442a5e1e4a2d68bd8d6cf823c8643314c2d58a","observation_id":"88527283-f309-4595-897a-6b934506ff0d","resolution":{"observed_at":"2026-05-20T13:33:30.001956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s verify step by step","venue":null,"work_id":"8bbe9a30-f09b-4de4-8689-a047c2afdc36","year":2024},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:05ec4bda585f9632062929d02e516b7aed55903346f990bcea3b0a3d359fce6d","observation_id":"5bd3a20a-4af3-4f08-a1dd-d340701256a6","resolution":{"observed_at":"2026-05-20T13:33:30.008122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":"2406.06592","doi":"10.48550/arxiv.2406.06592","metadata_source":"pith","pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","venue":"cs.CL","work_id":"9906447b-5bb3-4367-91f9-b9d556c9ee7f","year":2024},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:fba183cb90f788a925aed5f87ff8161b7de39a229c805845ec76a23fcb8d47c6","observation_id":"b5fd02f7-d1b5-4b53-a3b7-2f8d8221ec52","resolution":{"observed_at":"2026-05-20T13:33:19.266993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with LLMs.https://openai.com/index/learning-to-reason-with-llms/","venue":null,"work_id":"b963d864-83c8-40cf-bfd7-c9edaa587aee","year":2024},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:2c037fa4fe3ffc21bf75b438fcab5ddbbafd72327117b39c44de50cb5c8e3411","observation_id":"6de5dff7-98e3-470e-929c-34a50bf767d0","resolution":{"observed_at":"2026-05-20T13:33:29.981099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:6316a614d5bb2158ef44323476b84bf2a9951d40826dfde2a08f81af8521e35b","observation_id":"ee8cf371-d122-43e1-9e8c-205ee8378af7","resolution":{"observed_at":"2026-05-20T13:33:19.245999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27660","last_updated":"2026-07-27T14:08:20Z","snapshot_observed_at":"2026-08-02T15:12:46.749432Z","submitted_at":"2026-04-30T09:53:15Z","title":"From Context to Skills: Can Language Models Learn from Context Skillfully?","version":4},"cited_work":{"arxiv_id":"2604.27660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.27660","snapshot_observed_at":"2026-07-02T22:47:25.440075Z","title":"From Context to Skills: Can Language Models Learn from Context Skillfully?","venue":"cs.AI","work_id":"ace0099c-7ea2-41ee-a36d-0572733cf7f6","year":2026},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2604.27660","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:dfb4fc46d29c10a60a2b0e9c65df1db55440e4961415e812ac437c7b5671a87c","observation_id":"81ec88ef-28d3-429a-bcb3-6cd1398fe962","resolution":{"observed_at":"2026-05-20T13:33:19.234344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.882376Z","title":"Longcat-next: Lexicalizing modalities as discrete tokens","venue":null,"work_id":"b02143c1-c2e9-4a92-ad39-93f93fd2eba7","year":2026},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:b9a4f980b49e61302c469b6e3c28dc95b3e8726a3e21fc2dc8c01bc2d8c17fea","observation_id":"f68524b7-ad15-43ff-9729-cd6186729a94","resolution":{"observed_at":"2026-05-20T13:33:19.270466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20659","last_updated":"2026-04-22T15:08:58Z","snapshot_observed_at":"2026-07-06T23:07:14.243878Z","submitted_at":"2026-04-22T15:08:58Z","title":"GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning","version":1},"cited_work":{"arxiv_id":"2604.20659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20659","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning","venue":"cs.LG","work_id":"bbd532ff-17d8-44f9-bd0c-268196abf8c0","year":2026},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2604.20659","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:3a0ca043b0b6869a117c4b622b3a997ab3d83e9334e9e761067399e3a3a4c69e","observation_id":"8755cc8f-40e4-40c8-951a-0dde1d36f226","resolution":{"observed_at":"2026-05-20T13:33:19.228280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":"2312.08935","doi":"10.48550/arxiv.2312.08935","metadata_source":"pith","pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","venue":"cs.AI","work_id":"fb547990-d48e-4ba3-a047-af1e506e8290","year":2023},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:3849f403f3ef8ea43ab29f7fdde43a980eb600ab9eca27c8381813c253e27800","observation_id":"51f037e9-46c3-4fd7-bc1f-d69331ee3aa7","resolution":{"observed_at":"2026-05-20T13:33:19.253393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":"4c873d36-04d8-487f-9124-7c420146a845","year":2023},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:53d49fef0ccc8f0ed9bb31ddfc15b63ccdb95c8dc38227cb6ec8510abde0cba7","observation_id":"60c55ce6-0a68-4359-924b-d5c17da0b21c","resolution":{"observed_at":"2026-05-20T13:33:29.984784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"bb7fd278-7008-4dda-a3ac-be7e0f0401ed","year":2022},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:a5d32d09eef358f307df3346fd0dc7d51b8e2cc88fcfce86cfec61ce2c91395f","observation_id":"d55849a0-be20-4661-94b8-deae9ac5eacb","resolution":{"observed_at":"2026-05-20T13:33:29.996149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":"28d7faa6-ff67-4232-9d8a-4a05337d7337","year":1992},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:9ef1f0152124562de2850e396acd516cb5b453285fe5c3729b69b50a4b690596","observation_id":"4f273bfa-a752-401a-868d-710693e26ba2","resolution":{"observed_at":"2026-05-20T13:33:29.979214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.06626","last_updated":"2026-05-24T09:37:35Z","snapshot_observed_at":"2026-08-02T21:50:53.342047Z","submitted_at":"2026-02-22T06:09:57Z","title":"Grouter: Decoupling Routing from Representation for Accelerated MoE Training","version":2},"cited_work":{"arxiv_id":"2603.06626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.06626","snapshot_observed_at":"2026-06-30T19:05:00.368304Z","title":"Grouter: Decoupling routing from representation for accelerated moe training","venue":"cs.LG","work_id":"3e2ab3e9-8cc0-4960-8581-f6ab052ebbce","year":2026},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2603.06626","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:241d5bd2dc3457bfe843740ae765314a4dde7e947036b6ddd0d7129f9f2dcbfa","observation_id":"41de338a-be42-471d-9703-ae9c83707a3f","resolution":{"observed_at":"2026-05-26T02:03:10.990663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:62f1bba9d2aa5ce07d39052246827c718f22d0a6b34b6e1accfbdda8ae7eaec0","observation_id":"7ab392d1-4bd7-4711-8f8a-b6e1ba7467da","resolution":{"observed_at":"2026-05-20T13:33:19.259761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:8e31d8763f3d2e8cfcb382d812cf27583c89ee98b320dc09e6036705430bb0d6","observation_id":"f41140d8-d977-4be8-95ee-05938c66645e","resolution":{"observed_at":"2026-05-20T13:33:19.273497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09574","last_updated":"2026-05-28T07:00:50Z","snapshot_observed_at":"2026-08-02T05:56:59.665239Z","submitted_at":"2025-07-13T10:52:59Z","title":"MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models","version":3},"cited_work":{"arxiv_id":"2507.09574","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09574","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mentor: Efficient multimodal-conditioned tuning for autoregressive vision generation models","venue":null,"work_id":"ad5eba07-b8cf-4b03-8ac7-b865e719f4f3","year":2025},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2507.09574","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:c015ab9dab2ae5a66a860b2fcb24992d34c72f58cbeacb4cd64b16fddfa97b64","observation_id":"db987f36-1fe8-4fd6-b475-5ceacfa11467","resolution":{"observed_at":"2026-05-29T02:04:54.697622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"### Step N","venue":null,"work_id":"bf82d546-1727-4afc-9e54-2874ea93dc91","year":2023},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:4ded3c2e6259835525c36f35df875cebe16af6ec8865731b4c80eb93c88b530e","observation_id":"3a794f11-ef10-439f-8406-0b7510fb5881","resolution":{"observed_at":"2026-05-20T13:33:29.982894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c59d03b8-9d06-4231-8322-859f685634f2","year":null},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:5bf9ea13888f1142217ad703cb57512d55770b484fb1e4f75d7d603903c7429e","observation_id":"b8f17991-d620-441a-934c-8944b476935f","resolution":{"observed_at":"2026-05-20T13:33:29.977125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c2e3d0ee-2653-4b80-86a1-df126dd94c44","year":null},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:eece54a507a45bc60f67b5138fb9299c85f3a6fb153eb7f761b201c56f0ef794","observation_id":"08dd61c5-18b2-4f2a-8a00-a2cced80459a","resolution":{"observed_at":"2026-05-20T13:33:29.975001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CORRECT” if the step is logically and mathematically correct •“INCORRECT","venue":null,"work_id":"9cebbebf-e15b-4e46-9ba1-fa252b684629","year":2048},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:abd7f95c3353f82a18bc41cf64769af7d18071072bbc867c9a2557e3834e900e","observation_id":"135e2db5-1a30-4880-826e-773baf10d53f","resolution":{"observed_at":"2026-05-20T13:33:29.993730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5505311a-22f3-4375-afbf-e4e641a13d8a","year":null},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:1299dee61f145d77dbd5f7d77bc13ae2d09686d871e8a6943298c75e6eff7d99","observation_id":"08d8ef37-71af-4ccd-b066-4b8279dd96bb","resolution":{"observed_at":"2026-05-20T13:33:29.989204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13abb40c-ec8b-46fd-a48c-674ea03bc67e","year":null},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:e67736db3af1f5062fd521b2b6c69238093d85d6e0b504459d93957631f84d9c","observation_id":"cb819e68-bec2-48f3-b03b-1b4f0c59b891","resolution":{"observed_at":"2026-05-20T13:33:30.004003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2066.5470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"valid\": true or false","venue":null,"work_id":"10871593-83e9-4fae-8117-99e35d4f1dd1","year":2066},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:aa156be5e551c5ac965990f6463431bb3a07d2af69bab5c3dfe2967517c2ef42","observation_id":"750feb92-579e-4e7b-9f18-d465435178f0","resolution":{"observed_at":"2026-05-20T13:33:19.256550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"16e01f90-ecc6-40c7-9754-a3df9459d1ed","year":null},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:35d07ee73fe4a61e1535392668ea876e0490a8406664f80e1dbc2e5cdbc69d46","observation_id":"36bac34e-5768-497a-b0b8-b2fc2bb8e02a","resolution":{"observed_at":"2026-05-20T13:33:29.991310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proof.Follows directly from Propositions O.1 and O.2","venue":null,"work_id":"57ae70bd-baba-4c13-a4ec-6396266b0ec8","year":null},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:a3dc33ed16141fc52751e0c79356022a33d9006ff626d51d9ee631f65cc20a92","observation_id":"29a93bac-9cb3-410d-83d7-73695b7b3446","resolution":{"observed_at":"2026-05-20T13:33:30.006293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":15,"verified_fuzzy":14},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 4 inbound Pith citation observations for arXiv:2605.17291."}