{"as_of":"2026-08-08T06:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ac4bad45c676f7cc956e6fb0847f2e2f2af51528322659cea3d2c0b5e1ccf6d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:35.711109Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:47:38.261871Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":"2310.00212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-07-03T04:47:38.261871Z","title":"Pairwise proximal policy op- timization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"853378e7-11bf-46ba-9e05-f7a91ee37093","year":2023},"citing_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T09:34:04.394588Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2403.07691"},"observation_digest":"sha256:d5acf8c0521bd0ba02bf7a705f85d1803a733e125609a8e711e819b6c6608353","observation_id":"0822a513-5769-4aa4-b39b-653923605c68","resolution":{"observed_at":"2026-05-16T09:34:04.717075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":"2310.00212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-07-03T04:47:38.261871Z","title":"Pairwise proximal policy op- timization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"853378e7-11bf-46ba-9e05-f7a91ee37093","year":2023},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:df4f729156f55af887f72e0bf4ee06809ff958a66e5ed4b7a6ec8ae9d73158c2","observation_id":"d363611e-b4c9-47ae-8414-9e34bfd6599a","resolution":{"observed_at":"2026-05-23T20:58:25.791637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":"2310.00212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-07-03T04:47:38.261871Z","title":"Pairwise proximal policy op- timization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"853378e7-11bf-46ba-9e05-f7a91ee37093","year":2023},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:708e329b0c5367c385179b91fb9f4107d6bb735f942e2af1cd13ddd450074c8d","observation_id":"cb2943a0-b525-4bb0-9e86-0a48b51ea40b","resolution":{"observed_at":"2026-05-22T19:32:01.158186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-08-07T14:16:35.711109Z","title":"Pairwise proximal policy optimization: Harnessing relative feedback for llm alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.711109Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:d2f1d8cbdb953ee28a2d699484a059a92005a3acb489eb8c0282def897bdf74e","observation_id":"7f645668-9c8f-4882-b23b-0fe5ee70045a","resolution":{"observed_at":"2026-08-07T14:16:35.711109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":"2310.00212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-07-03T04:47:38.261871Z","title":"Pairwise proximal policy op- timization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"853378e7-11bf-46ba-9e05-f7a91ee37093","year":2023},"citing_paper":{"arxiv_id":"2604.19016","last_updated":"2026-04-21T03:06:50Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T03:06:50Z","title":"AlignCultura: Towards Culturally Aligned Large Language Models?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T02:36:36.854805Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2604.19016"},"observation_digest":"sha256:0f635b481fb283d988b6bf18a81a9cbe19c717332a2c46af946c3a220761eeab","observation_id":"9b7fd5a2-c199-4aaf-b7fb-24f6c33f8a3c","resolution":{"observed_at":"2026-05-11T12:56:04.922997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":"2310.00212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-07-03T04:47:38.261871Z","title":"Pairwise proximal policy op- timization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"853378e7-11bf-46ba-9e05-f7a91ee37093","year":2023},"citing_paper":{"arxiv_id":"2605.06987","last_updated":"2026-05-07T22:05:23Z","snapshot_observed_at":"2026-07-31T05:30:22.249144Z","submitted_at":"2026-05-07T22:05:23Z","title":"Response Time Enhances Alignment with Heterogeneous Preferences","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-11T01:04:26.288913Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2605.06987"},"observation_digest":"sha256:4b10148a9a2040f5c51857f99d15ab146d9c0a17ea8f3103866f60098e84bbfc","observation_id":"7d2c28ee-e210-4f24-9bea-aaea8b2cfe68","resolution":{"observed_at":"2026-05-11T04:45:59.491832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":"2310.00212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-07-03T04:47:38.261871Z","title":"Pairwise proximal policy op- timization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"853378e7-11bf-46ba-9e05-f7a91ee37093","year":2023},"citing_paper":{"arxiv_id":"2606.10321","last_updated":"2026-06-09T02:18:30Z","snapshot_observed_at":"2026-08-07T05:46:39.336758Z","submitted_at":"2026-06-09T02:18:30Z","title":"Baseline-Free Policy Optimization for Neural Combinatorial Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T13:44:24.539906Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2606.10321"},"observation_digest":"sha256:c299a3e38e0b753e604dd9cd082ebf7260f618dc01f701794b75a96c750a1ade","observation_id":"62cb8b9e-2542-4a54-aa8b-506b9a52933f","resolution":{"observed_at":"2026-07-03T04:37:37.534237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":"2310.00212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-07-03T04:47:38.261871Z","title":"Pairwise proximal policy op- timization: Harnessing relative feedback for llm alignment","venue":null,"work_id":"853378e7-11bf-46ba-9e05-f7a91ee37093","year":2023},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:76374665018ca9ddccb2d61e915d8346da455304cafe9d714b94b3c2794e8ee4","observation_id":"3e8c120f-eb0a-4277-be2c-af50c8101191","resolution":{"observed_at":"2026-07-03T04:47:38.263618Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.00212/citation-record","integrity":"/paper/2310.00212/integrity","json":"/paper/2310.00212/citation-record.json","paper":"/paper/2310.00212"},"outbound":[],"paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2310.00212."}