{"as_of":"2026-08-07T18:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:211911ee46da079a49b3da60acfd2084338fe8668bc58f791c1bd68f03f18a66","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:28.390947Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T06:56:44.378731Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-07T12:44:20.211826Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23729","last_updated":"2025-05-31T23:47:06Z","snapshot_observed_at":"2026-08-07T12:36:30.893158Z","submitted_at":"2025-05-29T17:56:05Z","title":"Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:20.211826Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2505.23729"},"observation_digest":"sha256:c5a79ef2033458e370f793f21b479804cbced2cbb24464fe535b32b3c528f215","observation_id":"c3258aed-6092-456c-8e05-fe4a1ca085de","resolution":{"observed_at":"2026-08-07T12:44:20.211826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-07T13:21:28.390947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23829","last_updated":"2025-05-28T08:09:10Z","snapshot_observed_at":"2026-08-07T13:12:58.459526Z","submitted_at":"2025-05-28T08:09:10Z","title":"BiasFilter: An Inference-Time Debiasing Framework for Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:21:28.390947Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2505.23829"},"observation_digest":"sha256:29a78d95fe72b9f9b13df57412b1abdc3b7cf0a81b35746a81a6c81dfb472208","observation_id":"9eabd63f-8d6d-4fa7-a945-faa52e58f4af","resolution":{"observed_at":"2026-08-07T13:21:28.390947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2506.00166","last_updated":"2026-04-30T20:54:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T19:11:52Z","title":"Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T11:52:36.688263Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2506.00166"},"observation_digest":"sha256:dde0a7241fe8a8c43b2345cb7a24ad446f0a0b1f005715cc1a531cffa8ea55c2","observation_id":"8ae2857e-1b3d-4a3a-bc91-16c3ace39994","resolution":{"observed_at":"2026-05-19T11:53:03.597106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-07T05:14:57.257974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09085","last_updated":"2025-06-10T08:10:16Z","snapshot_observed_at":"2026-08-07T05:05:12.126967Z","submitted_at":"2025-06-10T08:10:16Z","title":"LLM-ML Teaming: Integrated Symbolic Decoding and Gradient Search for Valid and Stable Generative Feature Transformation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:57.257974Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2506.09085"},"observation_digest":"sha256:208b514cd8de5ff0410156c2305d59814a81f394b87969863609f5ee3efceefa","observation_id":"55bc5fd5-0f8d-40b5-8ddd-d4c87946db01","resolution":{"observed_at":"2026-08-07T05:14:57.257974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-06T19:28:55.771105Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-06T19:12:50.807722Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:55.771105Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:0f9dad46afbe5f87518ed3bd3f7ed4d5f58828abe5262aaa09d2f4c2c3b0123d","observation_id":"a3223f1b-673c-43ab-ae62-693610b0990b","resolution":{"observed_at":"2026-08-06T19:28:55.771105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2507.06419","last_updated":"2026-06-04T20:44:16Z","snapshot_observed_at":"2026-08-06T19:02:44.982053Z","submitted_at":"2025-07-08T21:56:33Z","title":"Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-19T05:16:22.274580Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.06419"},"observation_digest":"sha256:43029e83d930674386b1cde7d7aee60cd33bfc5a49af3f9b189d2362604f6179","observation_id":"041852b0-1b03-4c76-b9c6-1bf402807f70","resolution":{"observed_at":"2026-05-19T05:17:05.872167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-06T18:51:32.704726Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-07T07:45:12.503295Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.704726Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:25eb979984754a9700740dd041190ab00ab0b99eacf9a2e11b852e201801f615","observation_id":"e6a67e93-2552-4e32-97b0-f01c49869cd0","resolution":{"observed_at":"2026-08-06T18:51:32.704726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-06T16:34:25.063586Z","title":"Args: Alignment as reward-guided search.arXiv preprint arXiv:2402.01694,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.063586Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:384391c748cef6d86bb7ccaf401b5ec2ca5f001fb795621d74c35e385f917592","observation_id":"50e73708-3b7d-4fc0-90bc-a99fa3c9ceb4","resolution":{"observed_at":"2026-08-06T16:34:25.063586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-05T21:18:42.488047Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09016","last_updated":"2025-09-10T05:08:47Z","snapshot_observed_at":"2026-08-05T21:18:35.909741Z","submitted_at":"2025-08-12T15:30:44Z","title":"A Survey on Training-free Alignment of Large Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T21:18:42.488047Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2508.09016"},"observation_digest":"sha256:37b7109ae840d632b8b0e476edb3e8d4f43d345acdfddbbe6061518fbb55437c","observation_id":"0b960119-1126-497f-8a76-8dfbd9da11f7","resolution":{"observed_at":"2026-08-05T21:18:42.488047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-04T18:09:37.443627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10147","last_updated":"2025-09-12T11:20:11Z","snapshot_observed_at":"2026-08-06T04:22:58.599012Z","submitted_at":"2025-09-12T11:20:11Z","title":"Virtual Agent Economies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:09:37.443627Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2509.10147"},"observation_digest":"sha256:1416f425ba6eae0ac9e1389ff7acbf0ecc2b8114044b7850df790816c5a68112","observation_id":"58f9ff3c-6405-491a-bbab-d6af7d01fcbe","resolution":{"observed_at":"2026-08-04T18:09:37.443627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-04T13:52:11.128628Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24696","last_updated":"2026-05-30T14:42:04Z","snapshot_observed_at":"2026-08-06T21:31:25.348106Z","submitted_at":"2025-09-29T12:28:23Z","title":"T-POP: Test-Time Personalization with Online Preference Feedback","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T13:52:11.128628Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2509.24696"},"observation_digest":"sha256:789b8d869cff7bd7196ea0745adb82d77bd89d442f498ecac74a39a0b2c2d30e","observation_id":"94dfb535-c47f-463f-9aa0-cb9d3c44c5c4","resolution":{"observed_at":"2026-08-04T13:52:11.128628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-04T13:15:44.167888Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01167","last_updated":"2026-05-30T06:40:26Z","snapshot_observed_at":"2026-08-04T13:15:39.949629Z","submitted_at":"2025-10-01T17:54:15Z","title":"Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T13:15:44.167888Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2510.01167"},"observation_digest":"sha256:5bd1120da969c753d5c77f219bde3694ec71b7eb19e3f7f7d2fe162a87cfceed","observation_id":"b8888d26-c4bb-474f-8d6e-a3042504f5fd","resolution":{"observed_at":"2026-08-04T13:15:44.167888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-04T10:09:02.535591Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-07T05:29:15.312231Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.535591Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:6039b46d0123cb89b44f32066f5824a7022790697a0f79a0f144fb5c9158c60d","observation_id":"80061e44-3d5b-4f76-975c-ae0241157149","resolution":{"observed_at":"2026-08-04T10:09:02.535591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-03T06:06:23.362311Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-05T00:08:42.424141Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.362311Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:6dc50bd5f04c5f08ffcfd6ec4376f7fea2b0c8a22121cb6f8384c78fe8f685d4","observation_id":"0ce5fda3-b4e0-4e8f-b7b2-94d90910bdd8","resolution":{"observed_at":"2026-08-03T06:06:23.362311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2604.12479","last_updated":"2026-04-14T09:03:05Z","snapshot_observed_at":"2026-07-31T18:49:55.634850Z","submitted_at":"2026-04-14T09:03:05Z","title":"Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:06:43.463303Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2604.12479"},"observation_digest":"sha256:2a34a3a3ad75dd675ac189d389959637f2e73e7a0cc38dd27849857f7e59759c","observation_id":"63eda618-2b8d-4180-ae03-67eaa70e4fea","resolution":{"observed_at":"2026-05-11T11:11:05.309215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2604.19018","last_updated":"2026-04-21T03:09:46Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T03:09:46Z","title":"Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-10T02:31:07.932802Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2604.19018"},"observation_digest":"sha256:1d18a17474060ab587f761fabd7a1348ec818fe9f883a8519afb13e466b30bcb","observation_id":"8b261bb4-3bc0-405d-8574-37ed6cabbf66","resolution":{"observed_at":"2026-05-11T13:01:03.967708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2604.23543","last_updated":"2026-04-26T05:41:40Z","snapshot_observed_at":"2026-07-06T23:09:43.659053Z","submitted_at":"2026-04-26T05:41:40Z","title":"Pref-CTRL: Preference Driven LLM Alignment using Representation Editing","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T06:28:14.378602Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2604.23543"},"observation_digest":"sha256:dc479802c1b5dabf11759ed143a3d0120de48b274454014deffbb0b3196ec78a","observation_id":"68bba25e-0882-401e-95c8-7161af716b3f","resolution":{"observed_at":"2026-05-11T21:11:19.384158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2605.10843","last_updated":"2026-05-18T13:29:46Z","snapshot_observed_at":"2026-08-02T08:40:11.399992Z","submitted_at":"2026-05-11T16:55:16Z","title":"Training-Free Cultural Alignment of Large Language Models via Persona Disagreement","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T22:19:33.582024Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2605.10843"},"observation_digest":"sha256:04878994591335b6344d9390d6d76e305e455dc36061dd36e23fbe1b9332e501","observation_id":"0fdb043b-ea26-481c-b498-e96acf9505b8","resolution":{"observed_at":"2026-05-20T22:23:48.490580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2605.20408","last_updated":"2026-05-19T19:04:47Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:04:47Z","title":"Spectral Souping: A Unified Framework for Online Preference Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:56.356555Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2605.20408"},"observation_digest":"sha256:4a2761c5b847443070e04e303cfff0c1774cb5956b77b06958b47c034858de24","observation_id":"6e3afd58-137b-463b-ad8d-35702c7b44c6","resolution":{"observed_at":"2026-05-21T07:59:50.948373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2605.21851","last_updated":"2026-05-22T00:42:32Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T00:55:13Z","title":"OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T08:10:55.720464Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2605.21851"},"observation_digest":"sha256:c973ed470abd3cd6d97a8b510a9db2ca621a67ae29dceff87dbd44d87a4b03eb","observation_id":"7b6cdbd5-0343-4c1f-ae14-6ef2bd6f0982","resolution":{"observed_at":"2026-05-22T08:11:17.008018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2605.21851","last_updated":"2026-05-22T00:42:32Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T00:55:13Z","title":"OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T05:47:33.925413Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2605.21851"},"observation_digest":"sha256:85c236f549224ca9a859f6873671294c4c48e6bd3fc431043bff31405846f004","observation_id":"3bbb5d27-7c5d-49d2-b8c2-2b40751759b5","resolution":{"observed_at":"2026-05-25T05:50:24.337367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":"2402.01694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-02T06:56:44.378731Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"1d2992cb-4f16-4b6c-8cd5-d673b6077123","year":2024},"citing_paper":{"arxiv_id":"2606.04775","last_updated":"2026-06-03T11:58:56Z","snapshot_observed_at":"2026-08-01T08:35:34.804943Z","submitted_at":"2026-06-03T11:58:56Z","title":"Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T07:18:51.066384Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2606.04775"},"observation_digest":"sha256:770261640ab9ada42f968e6f78b0da27e5ff4337e56e5b2858d34e1609d551bd","observation_id":"2daf7f82-38aa-4714-815e-050469ebd7b7","resolution":{"observed_at":"2026-07-02T06:56:44.380450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2402.01694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-02T20:53:24.751933Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:60f589cbc739777fb4b534ef058a281ce125f10ddb2e47a33adee57c6963f06f","observation_id":"2aec05c3-0fba-4c6c-9285-d088541337c5","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-31T23:14:22.758776Z","title":"arXiv preprint arXiv:2402.01694","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27912","last_updated":"2026-07-30T09:26:06Z","snapshot_observed_at":"2026-08-06T16:44:37.894744Z","submitted_at":"2026-07-30T09:26:06Z","title":"IFHierBench: Hierarchical Instruction Following for Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T23:14:22.758776Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2607.27912"},"observation_digest":"sha256:0332b04ff1031aac6b0d59686f86bba7a8aefbf1c442447587893c68e653de74","observation_id":"71560dde-6950-480f-8a10-0553bd785f97","resolution":{"observed_at":"2026-07-31T23:14:22.758776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.01694/citation-record","integrity":"/paper/2402.01694/integrity","json":"/paper/2402.01694/citation-record.json","paper":"/paper/2402.01694"},"outbound":[],"paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2402.01694."}