{"as_of":"2026-08-08T02:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f08c5d0b9b489003199face22f178d4f3cb03f026d47d170b950bb0b85ba6330","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:31:02.541976Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:49:46.153282Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-07T11:31:02.541976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-08-07T23:33:16.117972Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:31:02.541976Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2506.02355"},"observation_digest":"sha256:6c2d4076a7bd1acf64418f7e902840aa6c3e39f69a1e27a3245371befceb0ee0","observation_id":"7adeef12-ffdc-4e0e-8f99-e1f659d5405b","resolution":{"observed_at":"2026-08-07T11:31:02.541976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-06T21:13:13.002002Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00711","last_updated":"2025-07-01T12:14:22Z","snapshot_observed_at":"2026-08-07T07:21:03.621965Z","submitted_at":"2025-07-01T12:14:22Z","title":"Large Reasoning Models are not thinking straight: on the unreliability of thinking trajectories","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:13.002002Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2507.00711"},"observation_digest":"sha256:36f29450899420fa29428db583bd4d03dc33fb2436f4caf8a99fa372cdaa3327","observation_id":"a5a03000-ddb6-4db8-a58a-639361ea3c9c","resolution":{"observed_at":"2026-08-06T21:13:13.002002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-06T17:52:01.663454Z","title":"org/abs/2503.19595","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10616","last_updated":"2025-07-25T11:09:53Z","snapshot_observed_at":"2026-08-06T17:46:01.198994Z","submitted_at":"2025-07-13T19:04:17Z","title":"Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:01.663454Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2507.10616"},"observation_digest":"sha256:deb7ec8c5702a95ea2bb6db4913d79e9790159f2e3cbdd2ed2d719ece34e1559","observation_id":"dc56e706-31a6-4160-9c14-1dbfeae88be1","resolution":{"observed_at":"2026-08-06T17:52:01.663454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-05T20:21:08.184900Z","title":"Optimizing language models for inference time objectives using reinforcement learning.CoRR, abs/2503.19595, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.184900Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:9f243c5fad94f7ce28bdc7c7cebac5009a796e633b97e6f3009c02c02aa7cc7e","observation_id":"8e997e85-8055-440b-a0ec-1515799f464c","resolution":{"observed_at":"2026-08-05T20:21:08.184900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-04T22:59:14.565055Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.565055Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:0e828bfec359f85fc48e298ca66843b35d980e4e86a2729562e87af46769af1f","observation_id":"0d78bad3-7a1d-4923-8247-095ae001384d","resolution":{"observed_at":"2026-08-04T22:59:14.565055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:18ce067e8f45b79002f9e20d8a444d16620005b2d7f0e7128140be5903868c3f","observation_id":"d88b1852-3a90-4dcb-bae8-f1db68cd280a","resolution":{"observed_at":"2026-05-18T11:56:19.949595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2604.24957","last_updated":"2026-05-19T21:17:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T19:52:38Z","title":"Compute Aligned Training: Optimizing for Test Time Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:53.868648Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2604.24957"},"observation_digest":"sha256:c2d31cabd90c8ed790869cca43003c8814afc1483ddb6ca5dc4dffbc6cdfe06e","observation_id":"2a0054f3-e5f2-4003-b4dd-a3e9efec7692","resolution":{"observed_at":"2026-05-11T21:51:11.736090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2604.24957","last_updated":"2026-05-19T21:17:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T19:52:38Z","title":"Compute Aligned Training: Optimizing for Test Time Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T08:41:49.623026Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2604.24957"},"observation_digest":"sha256:a5b512295e8c9b3c43c987d073cddfe783006e03d2c78727cf2fa484ce3624c8","observation_id":"05744ee3-eb1e-4fbe-a30f-504c9100dca0","resolution":{"observed_at":"2026-05-21T08:44:04.622393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2605.10716","last_updated":"2026-05-11T15:25:29Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T15:25:29Z","title":"What should post-training optimize? A test-time scaling law perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T05:20:18.754351Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2605.10716"},"observation_digest":"sha256:ad8f7d4774fee728392dab159d9d71dfc771ab583260b4c4f3f08b0e03733108","observation_id":"be2fa0bb-81f2-437a-a626-b5ae1935083e","resolution":{"observed_at":"2026-05-12T05:21:23.886212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T06:01:17.988127Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2605.20854"},"observation_digest":"sha256:313da6a671adffad686724b2e577211ce29c5a43fc11d4b8548a37bfd4e285b7","observation_id":"4bdf7ce1-4a7e-44ec-a1fb-7202912bab31","resolution":{"observed_at":"2026-05-21T06:03:59.243572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2606.18910","last_updated":"2026-06-17T10:37:23Z","snapshot_observed_at":"2026-08-02T21:25:42.997753Z","submitted_at":"2026-06-17T10:37:23Z","title":"REVES: REvision and VErification--Augmented Training for Test-Time Scaling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:15.337979Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2606.18910"},"observation_digest":"sha256:577c9eb48278b19677ed89a53794444f939f7ab7737f35c02503f8187a08a4d5","observation_id":"21aa595f-745b-4e8d-88c1-dd996626182f","resolution":{"observed_at":"2026-07-04T00:29:15.155048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2606.23595","last_updated":"2026-06-22T17:02:09Z","snapshot_observed_at":"2026-08-02T13:00:59.578833Z","submitted_at":"2026-06-22T17:02:09Z","title":"SPIRAL: Learning to Search and Aggregate","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T08:29:22.303745Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2606.23595"},"observation_digest":"sha256:3f3a1b7b62958b1074256d8459c8c0d3f37474cca6fbfcc106248541c95e4b73","observation_id":"448581c1-4c99-47da-9b30-d6f176b30e11","resolution":{"observed_at":"2026-07-04T10:49:46.154935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2607.01490","last_updated":"2026-07-01T21:39:19Z","snapshot_observed_at":"2026-08-07T23:25:45.641736Z","submitted_at":"2026-07-01T21:39:19Z","title":"Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-03T20:59:57.539909Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2607.01490"},"observation_digest":"sha256:77eb4503eda686dc273f9f18a06455bda46bee421a4e81d58eed08fcf11c10d8","observation_id":"8b568f87-3394-4b10-8ef4-3182ee70016c","resolution":{"observed_at":"2026-07-03T21:08:57.761591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2607.02390","last_updated":"2026-07-02T16:25:10Z","snapshot_observed_at":"2026-08-03T00:49:51.748486Z","submitted_at":"2026-07-02T16:25:10Z","title":"DecompRL: Solving Harder Problems by Learning Modular Code Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-03T16:30:34.793328Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2607.02390"},"observation_digest":"sha256:8b5334d3f15e762ef02772ec2597062e35c72867208893b764a0a5151cba5bef","observation_id":"77e2b571-845e-4398-8209-3bd9b587979a","resolution":{"observed_at":"2026-07-03T16:38:39.754675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.19595/citation-record","integrity":"/paper/2503.19595/integrity","json":"/paper/2503.19595/citation-record.json","paper":"/paper/2503.19595"},"outbound":[],"paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T16:38:33.934628Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2503.19595."}