{"as_of":"2026-08-05T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12b1bd0b63d09b7c4feed3c57ade08e26c5af57be084067069473a3a555b3608","coverage":[{"denominator":5,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:01:04.393062Z","state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.07506/citation-record","integrity":"/paper/2604.07506/integrity","json":"/paper/2604.07506/citation-record.json","paper":"/paper/2604.07506"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2604.07506","last_updated":"2026-04-19T14:50:17Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T18:46:12Z","title":"ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:01:04.393062Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2604.07506"},"observation_digest":"sha256:e865c345012600bda32d04c5d70a1f2d127ad75557025b568cf796a5f18932a3","observation_id":"8100f572-e939-4952-a7cb-e28305aca3a1","resolution":{"observed_at":"2026-05-13T06:07:56.884714Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2410.12832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-07-08T17:55:20.847513Z","title":"Generative reward models","venue":"cs.LG","work_id":"23ed8cd6-2e8b-4d27-8d71-9e2c7e958e9b","year":2024},"citing_paper":{"arxiv_id":"2604.07506","last_updated":"2026-04-19T14:50:17Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T18:46:12Z","title":"ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:01:04.393062Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2604.07506"},"observation_digest":"sha256:ea4528879249d160265156f6ddb988495338714aa2b9e611665de9682616ee6c","observation_id":"7a1cbc90-4fe2-4ab9-b500-0e68866dcaaa","resolution":{"observed_at":"2026-05-11T05:40:57.754795Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.13914","doi":"10.48550/arxiv.2504.13914","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed1.5-thinking: Advancing superb reasoning models with reinforce- ment learning","venue":"ArXiv.org","work_id":"1eaca2b2-5ee7-4243-b8f5-117441248181","year":2025},"citing_paper":{"arxiv_id":"2604.07506","last_updated":"2026-04-19T14:50:17Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T18:46:12Z","title":"ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:01:04.393062Z"},"links":{"citing_paper":"/paper/2604.07506"},"observation_digest":"sha256:d911d7d1b46073931d52bd980086966d3d68e91ceb5af6c4261b6e84aa6cd70e","observation_id":"dfaab1f6-00f2-46c1-9490-45ea81b54b21","resolution":{"observed_at":"2026-05-11T05:40:57.715450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2604.07506","last_updated":"2026-04-19T14:50:17Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T18:46:12Z","title":"ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:01:04.393062Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2604.07506"},"observation_digest":"sha256:10bbf5130e87c4a218c39406ef267540259efca25eec40d5bbcaf74db8ba33e9","observation_id":"a73a7e5e-3ddb-4fd7-9012-903b049b95d5","resolution":{"observed_at":"2026-05-11T05:40:57.742179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.07506","last_updated":"2026-04-19T14:50:17Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T18:46:12Z","title":"ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:01:04.393062Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.07506"},"observation_digest":"sha256:6047b1f0a61920db7a134eed47316bd556a59d57e44786ec5e99a00c5bbe7aee","observation_id":"d6d6597b-00ba-4141-861f-4ce5338722b3","resolution":{"observed_at":"2026-05-11T05:40:57.734395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.07506","last_updated":"2026-04-19T14:50:17Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T18:46:12Z","title":"ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework"},"reference_resolution":{"displayed":5,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":5},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 5 of 5 outbound references and 0 inbound Pith citation observations for arXiv:2604.07506."}