{"as_of":"2026-08-23T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdf7247e6e070c2b5df73aa6b7b12d897cc679aa5e51b861b53ea6412da8e5bd","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:06:24.769271Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T16:26:34.918099Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T01:37:30.345559Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"cited_work":{"arxiv_id":"2602.02572","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02572","snapshot_observed_at":"2026-07-03T01:37:30.345559Z","title":"Reward shaping for inference-time alignment: A stackelberg game perspective","venue":"cs.LG","work_id":"061e198e-3a04-4343-8da2-4aa1e417784b","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-18T06:14:17.992551Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2602.02572","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:eb39fb9238a105706cd394f10a604254334f24865771e3b8be5241b91e0e1867","observation_id":"9bbed268-4dad-4fd9-ad83-4b80970051af","resolution":{"observed_at":"2026-06-09T03:07:10.188497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"cited_work":{"arxiv_id":"2602.02572","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02572","snapshot_observed_at":"2026-07-03T01:37:30.345559Z","title":"Reward shaping for inference-time alignment: A stackelberg game perspective","venue":"cs.LG","work_id":"061e198e-3a04-4343-8da2-4aa1e417784b","year":2026},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2602.02572","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:25f8f46e640e00e19b40165d5d9e58ec6ddc9a1c9b203d0394ef686a5caaabcc","observation_id":"d57426d3-0ff6-4fe3-8245-e818bf522e44","resolution":{"observed_at":"2026-07-03T01:37:30.346928Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.02572/citation-record","integrity":"/paper/2602.02572/integrity","json":"/paper/2602.02572/citation-record.json","paper":"/paper/2602.02572"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:22.563977Z","title":"Persistent anti-muslim bias in large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.563977Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:bc780cdd37e59784040831a789df0b082b518739303d190c7b8fbf582c18e16a","observation_id":"a9b43f2f-0b80-497a-8fff-94c0d560866c","resolution":{"observed_at":"2026-08-03T06:06:22.563977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.469882Z","title":"In contrast, when B is large, expected user utility initially increases with α but eventually degrades","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.469882Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:6030095f2f40269598d5465479a1069df678cd81a42080e690d858182a807952","observation_id":"3ff10d8f-afe3-464b-885a-22ea0178fcc6","resolution":{"observed_at":"2026-08-03T06:06:24.469882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-19T08:48:56.371619Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-03T06:06:22.831865Z","title":"Self-play fine-tuning converts weak language models to strong language models.arXiv preprint arXiv:2401.01335,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.831865Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:60d5e69eab3a5b4f1381ab351abd1df19de7c26da1cee90461d83c6cdd5f9d33","observation_id":"9622f0a8-fff5-4af3-bc82-b2a5c317209b","resolution":{"observed_at":"2026-08-03T06:06:22.831865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:22.892913Z","title":"Stackelberg game preference optimization for data-efficient alignment of language models.arXiv preprint arXiv:2502.18099,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.892913Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:d98ccef1b7d6d38caca03854afe21ab1de696a13902befa37864495c587c2b7f","observation_id":"90cc93f8-760a-4fcb-ade0-71c938838865","resolution":{"observed_at":"2026-08-03T06:06:22.892913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-03T06:06:22.938892Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.938892Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:21ecd2bab43e2632ff66b8785d7ec9b94c697f3f8caea17a2c01234083ab12c3","observation_id":"a78b3777-1720-4aac-8f48-19dd7acb5fa7","resolution":{"observed_at":"2026-08-03T06:06:22.938892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T06:06:23.100462Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.100462Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:171e62a27549db576c2286900d74265c47b2bbc02cba86918c6767fee15b69d9","observation_id":"19ef0cd4-3f38-4d63-9c94-f90d62084d57","resolution":{"observed_at":"2026-08-03T06:06:23.100462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18074","last_updated":"2024-10-07T16:46:42Z","snapshot_observed_at":"2026-08-16T13:31:04.606847Z","submitted_at":"2024-07-25T14:28:58Z","title":"Principal-Agent Reinforcement Learning: Orchestrating AI Agents with Contracts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18074","snapshot_observed_at":"2026-08-03T06:06:23.215338Z","title":"Principal-agent reinforcement learning: Orchestrating ai agents with contracts.arXiv preprint arXiv:2407.18074,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.215338Z"},"links":{"cited_paper":"/paper/2407.18074","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:c8b7bafaaa77b184a454ccdaa418eea61079d270686d052a7f207c3d88766347","observation_id":"d8a2cea7-0a82-4ab3-b5de-826e458c5c16","resolution":{"observed_at":"2026-08-03T06:06:23.215338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04274","last_updated":"2024-06-06T17:23:49Z","snapshot_observed_at":"2026-08-16T13:45:26.204308Z","submitted_at":"2024-06-06T17:23:49Z","title":"Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04274","snapshot_observed_at":"2026-08-03T06:06:23.264628Z","title":"Self-play with adversarial critic: Provable and scalable offline alignment for language models.arXiv preprint arXiv:2406.04274,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.264628Z"},"links":{"cited_paper":"/paper/2406.04274","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:95a7477042bb498514f6ddc9a05b519c20b2aa5443b37e1d82f08df2b9a60cbe","observation_id":"a845c286-8195-4ab7-bcbb-6aaeb6d0cce3","resolution":{"observed_at":"2026-08-03T06:06:23.264628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:23.311851Z","title":"Regularized best-of-n sampling to mitigate reward hacking for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.311851Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:162303a08debefa8784719ebbae55a1b0fc7fe7dc86329f3565a1bfaf9967adb","observation_id":"82323386-dc3b-43fb-a29d-cb314b8dfd28","resolution":{"observed_at":"2026-08-03T06:06:23.311851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-08-18T11:13:23.191794Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-03T06:06:23.362311Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.362311Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:d6e823fddbcd8b0a8749e4cc672ada8fa6b147eabc81a964fa84fea9f48389e4","observation_id":"0ce5fda3-b4e0-4e8f-b7b2-94d90910bdd8","resolution":{"observed_at":"2026-08-03T06:06:23.362311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05954","last_updated":"2024-11-01T17:46:46Z","snapshot_observed_at":"2026-08-18T10:32:32.430827Z","submitted_at":"2024-06-10T01:21:31Z","title":"Aligning Large Language Models with Representation Editing: A Control Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05954","snapshot_observed_at":"2026-08-03T06:06:23.421626Z","title":"Hadas Kotek, Rikker Dockum, and David Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.421626Z"},"links":{"cited_paper":"/paper/2406.05954","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:8f5660b17d3a88b0cb763e7bf66add126113bcef71ef9a0d6fb5d45c7cd082c6","observation_id":"377f2fb5-94e8-49db-a955-713eaa5d4c48","resolution":{"observed_at":"2026-08-03T06:06:23.421626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10199","last_updated":"2024-08-20T06:53:45Z","snapshot_observed_at":"2026-08-18T10:36:03.568204Z","submitted_at":"2024-04-16T00:50:43Z","title":"CULTURE-GEN: Revealing Global Cultural Perception in Language Models through Natural Language Prompting","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10199","snapshot_observed_at":"2026-08-03T06:06:23.465581Z","title":"Culture-gen: Revealing global cultural perception in language models through natural language prompting.arXiv preprint arXiv:2404.10199,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.465581Z"},"links":{"cited_paper":"/paper/2404.10199","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:bddfb97ec71c3c3ab8b054c95bc1543f3cfd5007760e4ed6a68f0ef11831f675","observation_id":"6568c070-7823-4fa9-961a-a6cbb678375e","resolution":{"observed_at":"2026-08-03T06:06:23.465581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:23.513804Z","title":"Red: Unleashing token-level rewards from holistic feedback via reward redistribution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.513804Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:b3fa8a43098563f0c0dc1d3782a2ba513dba37f51fb56cc4606f692393596dac","observation_id":"22810edb-4870-4918-8036-4b85ba90efa3","resolution":{"observed_at":"2026-08-03T06:06:23.513804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01352","last_updated":"2026-03-02T20:56:17Z","snapshot_observed_at":"2026-08-17T17:51:36.636502Z","submitted_at":"2025-07-02T04:40:29Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01352","snapshot_observed_at":"2026-08-03T06:06:23.565140Z","title":"Skywork-reward-v2: Scaling preference data curation via human-ai synergy.arXiv preprint arXiv:2507.01352,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.565140Z"},"links":{"cited_paper":"/paper/2507.01352","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:00aa8d3e43c607d1ec9df6165c17262f831b93b64521a25e01b7afcd862037b1","observation_id":"d8e97ca9-2072-4292-bbb5-ae7ba90057e8","resolution":{"observed_at":"2026-08-03T06:06:23.565140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17022","last_updated":"2024-06-03T20:50:26Z","snapshot_observed_at":"2026-08-16T14:48:48.486166Z","submitted_at":"2023-10-25T22:00:05Z","title":"Controlled Decoding from Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17022","snapshot_observed_at":"2026-08-03T06:06:23.621632Z","title":"Controlled decoding from language models.arXiv preprint arXiv:2310.17022,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.621632Z"},"links":{"cited_paper":"/paper/2310.17022","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:5607de7f460d3ab3482dbfd97d56256ac73b452a16b2b79dac54926b433313b3","observation_id":"dc54a390-813a-40cb-8573-e4fe20d25397","resolution":{"observed_at":"2026-08-03T06:06:23.621632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11137","last_updated":"2023-09-13T12:19:22Z","snapshot_observed_at":"2026-08-18T12:54:44.957758Z","submitted_at":"2023-07-20T17:19:15Z","title":"Of Models and Tin Men: A Behavioural Economics Study of Principal-Agent Problems in AI Alignment using Large-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11137","snapshot_observed_at":"2026-08-03T06:06:23.680034Z","title":"Of models and tin men: a behavioural economics study of principal-agent problems in ai alignment using large-language models.arXiv preprint arXiv:2307.11137,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.680034Z"},"links":{"cited_paper":"/paper/2307.11137","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:8d0903d9b642d10e612405e7ae0b9776b16bb666cc586631aece8883f8374af8","observation_id":"68e8ef3f-021f-44f6-93f5-41c99cdb020c","resolution":{"observed_at":"2026-08-03T06:06:23.680034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-17T02:24:53.749690Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-03T06:06:23.730311Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences.arXiv preprint arXiv:2404.03715,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.730311Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:6003f888c6cd204f9811a36899cbefa5c80387b95854929feaf6fdbb6261866d","observation_id":"f59d078f-612b-4b29-96c8-2b6e0079f15a","resolution":{"observed_at":"2026-08-03T06:06:23.730311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10076","last_updated":"2023-10-16T05:19:02Z","snapshot_observed_at":"2026-08-19T20:15:57.441818Z","submitted_at":"2023-10-16T05:19:02Z","title":"Verbosity Bias in Preference Labeling by Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10076","snapshot_observed_at":"2026-08-03T06:06:23.786849Z","title":"Verbosity bias in preference labeling by large language models.arXiv preprint arXiv:2310.10076,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.786849Z"},"links":{"cited_paper":"/paper/2310.10076","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:d53f1e5354f2cb0f64b2ec6df1082df271f3c88d3afadf1953a500a2bac26005","observation_id":"d21238ad-6117-4d70-b6d8-711f799a14eb","resolution":{"observed_at":"2026-08-03T06:06:23.786849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07708","last_updated":"2024-03-14T02:02:31Z","snapshot_observed_at":"2026-08-19T09:52:16.436560Z","submitted_at":"2024-03-12T14:51:57Z","title":"Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07708","snapshot_observed_at":"2026-08-03T06:06:23.835125Z","title":"Improv- ing reinforcement learning from human feedback using contrastive rewards.arXiv preprint arXiv:2403.07708,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.835125Z"},"links":{"cited_paper":"/paper/2403.07708","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:835c42660c209223b0322e7ab77d44c585c4b41f01db473f19de5bc9ac8a24d1","observation_id":"cf15c008-06bc-4e12-9c32-6ed24ac2e395","resolution":{"observed_at":"2026-08-03T06:06:23.835125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:23.894260Z","title":"Robust multi-objective controlled decoding of large language models.arXiv preprint arXiv:2503.08796,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.894260Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:67ab50d0a48a7d02fa29d9f1b3a1b064795c84313375db5b8671394ee1b427aa","observation_id":"54b6b150-4c10-4454-83f9-c1108497a144","resolution":{"observed_at":"2026-08-03T06:06:23.894260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-08-18T07:43:35.306326Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-03T06:06:23.941662Z","title":"A minimaxi- malist approach to reinforcement learning from human feedback.arXiv preprint arXiv:2401.04056,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.941662Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:bb67718116f5fcb3479809b28f00705b497f801354e57d02a448c177329c1bbe","observation_id":"ee96b49f-3cc8-47e0-9d31-f77649e93a17","resolution":{"observed_at":"2026-08-03T06:06:23.941662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00742","last_updated":"2024-07-19T05:12:15Z","snapshot_observed_at":"2026-08-20T23:48:48.792391Z","submitted_at":"2024-02-01T16:39:28Z","title":"Transforming and Combining Rewards for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00742","snapshot_observed_at":"2026-08-03T06:06:24.003533Z","title":"Transforming and combining rewards for aligning large language models.arXiv preprint arXiv:2402.00742,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.003533Z"},"links":{"cited_paper":"/paper/2402.00742","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:596d3622b05c5f9a9484b4b60a41e73d63def87bac9f26d1463a85b0cfbeb023","observation_id":"1378a620-b05f-49a2-b875-d8cf129227b0","resolution":{"observed_at":"2026-08-03T06:06:24.003533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08193","last_updated":"2025-07-15T00:32:25Z","snapshot_observed_at":"2026-08-18T11:13:29.901243Z","submitted_at":"2024-10-10T17:58:24Z","title":"GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08193","snapshot_observed_at":"2026-08-03T06:06:24.052889Z","title":"Genarm: Reward guided generation with autoregressive reward model for test-time alignment.arXiv preprint arXiv:2410.08193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.052889Z"},"links":{"cited_paper":"/paper/2410.08193","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:b16984e1ef0d504b8687115974b0a246e1abcc7dba5615a326779ae8341a7fc6","observation_id":"1272e9f4-5e14-47ea-9842-b35fa6d61fee","resolution":{"observed_at":"2026-08-03T06:06:24.052889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T06:06:24.108289Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.108289Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:b00967813f9bd92e4516e4d62471e6b1d8b36311349976e39e53ef88e7844134","observation_id":"2fbfd065-7f1f-43a4-81ba-b22b67e1d733","resolution":{"observed_at":"2026-08-03T06:06:24.108289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00617","last_updated":"2025-03-03T03:41:11Z","snapshot_observed_at":"2026-08-16T13:38:25.949959Z","submitted_at":"2024-06-30T08:00:34Z","title":"Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00617","snapshot_observed_at":"2026-08-03T06:06:24.161428Z","title":"Iterative nash policy optimization: Aligning llms with general preferences via no-regret learning.arXiv preprint arXiv:2407.00617,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.161428Z"},"links":{"cited_paper":"/paper/2407.00617","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:ad2188d5d9ba92675050f2ce7c90a5e3952a4dd35e0862ee25816574c8797393","observation_id":"e3367dc2-ea39-4b96-bdba-d8f844872624","resolution":{"observed_at":"2026-08-03T06:06:24.161428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11861","last_updated":"2025-05-17T06:02:00Z","snapshot_observed_at":"2026-08-19T09:53:23.971698Z","submitted_at":"2025-05-17T06:02:00Z","title":"Fair-PP: A Synthetic Dataset for Aligning LLM with Personalized Preferences of Social Equity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11861","snapshot_observed_at":"2026-08-03T06:06:24.211756Z","title":"Fair-pp: A synthetic dataset for aligning llm with personalized preferences of social equity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.211756Z"},"links":{"cited_paper":"/paper/2505.11861","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:7f62f6714f282aeef37872cb4b9a76e617d8fc17f92ba0c6f7b89a0e5869bca7","observation_id":"0f350215-e90e-4d8c-8481-074525852ad5","resolution":{"observed_at":"2026-08-03T06:06:24.211756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.278675Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.278675Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:4dc5298ebe6915e535b5922f31f45498b5a444f06de4ee29ffec3652d877c659","observation_id":"376c0293-8980-46a2-b094-0c5def82af85","resolution":{"observed_at":"2026-08-03T06:06:24.278675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.320298Z","title":"[2024], Ivanov et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.320298Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:79a32a2c2426570ff48d86311ffd58649b48c41a7b6ac3bee84b415f0f652257","observation_id":"5d396c6c-ed68-4576-a0a5-8507d036bfcf","resolution":{"observed_at":"2026-08-03T06:06:24.320298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.376327Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.376327Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:4ace1ae1ee9c78c9d27fdc02d13a68c40529bbdac358012e5bf9a54a666dba36","observation_id":"a068fe7e-abfb-4518-b45f-1a76a3203c66","resolution":{"observed_at":"2026-08-03T06:06:24.376327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.418484Z","title":"The model generates responses for 1,000 test prompts, of which 300 are randomly selected for GPT-4 evaluation against base-policy answers generated without alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.418484Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:59126f55184bdd954d6715aea6824b0452b90d1a17a48371c4d954a26de13b26","observation_id":"09309d26-586a-432a-87ee-ab2c36c32fc2","resolution":{"observed_at":"2026-08-03T06:06:24.418484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.553403Z","title":"This behavior indicates that the learned value function ˆQ(st,y ) fails to provide a meaningful estimate of the reward for expected model completions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.553403Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:bd8aa1dd639e64512e0d8f18ef9d9a9fc1b27292ca290ed64b97a4ff59e62f07","observation_id":"beff5586-f56f-4b10-a48f-b6c89cb1a75f","resolution":{"observed_at":"2026-08-03T06:06:24.553403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.668148Z","title":"Recall we also have ˆQr ˆm∗,α(st, yt)≤r max ≤B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.668148Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:3f0d744d2791e6546a5bf9ff588e945d098d6a62f9eb1447730884768c447b43","observation_id":"9f475aac-43d3-4cff-be7b-a8c450338468","resolution":{"observed_at":"2026-08-03T06:06:24.668148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:24.769271Z","title":"\"\"USER_PROMPT =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:24.769271Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:406f6f715f18c64389fa0c5ec7978e7276b85d0517116e307795977aa6ddb3e3","observation_id":"93d8e8a8-237e-479a-8b2b-f3ce778c67c8","resolution":{"observed_at":"2026-08-03T06:06:24.769271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:23.160214Z","title":"Incomplete contracting and ai alignment","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.160214Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:02c59b9dfd2aa132c812dda0bc5eb0b4ffd11df1ddd6a45fc0e7b8feab143b8c","observation_id":"e2040902-8b98-4aa3-af64-9a23b8da6c4c","resolution":{"observed_at":"2026-08-03T06:06:23.160214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-03T06:06:22.628259Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.628259Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:9aa875b5613af96b89fd824e91ba5b74ea32fd951e3756e025fb73aeb2f8783b","observation_id":"2a86dd72-d410-4993-82f2-8181493fb18b","resolution":{"observed_at":"2026-08-03T06:06:22.628259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:23.051021Z","title":"Reward shaping to mitigate reward hacking in rlhf.arXiv preprint arXiv:2502.18770,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.051021Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:352eac3ce8cfd34fbd1f147d50c5ccfab979dc90cc1c8227d50eb210f4c3133e","observation_id":"f658e658-2ded-4b04-b9a1-2270e55554e3","resolution":{"observed_at":"2026-08-03T06:06:23.051021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:22.990060Z","title":"Simple versus optimal contracts","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.990060Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:3539c13b8e2fd56976f6710ed24542e494947e6bf20b8862057886b224bd582f","observation_id":"b613c101-70ea-4240-afab-6f13686e4075","resolution":{"observed_at":"2026-08-03T06:06:22.990060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:06:22.681448Z","title":"Strategyproof reinforcement learning from human feedback.arXiv preprint arXiv:2503.09561,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.681448Z"},"links":{"citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:e69eeb7bda94edd16a58bb4cbdaf15bb9539630a0b447f7b04df93aade33f82f","observation_id":"98511649-daee-476a-8d0a-5445a8933dcd","resolution":{"observed_at":"2026-08-03T06:06:22.681448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02585","last_updated":"2024-04-30T21:05:21Z","snapshot_observed_at":"2026-08-16T15:10:58.024224Z","submitted_at":"2023-08-03T18:03:44Z","title":"PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02585","snapshot_observed_at":"2026-08-03T06:06:22.768128Z","title":"Parl: A unified framework for policy alignment in reinforcement learning from human feedback.arXiv preprint arXiv:2308.02585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:22.768128Z"},"links":{"cited_paper":"/paper/2308.02585","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:488ed2eb709eaa0fe7be5e48da0f9b14d5199e75bca91cfcb43e56d654c88080","observation_id":"259c1238-4e92-4686-b67a-8bcbf4f5ffce","resolution":{"observed_at":"2026-08-03T06:06:22.768128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T14:50:28.091811Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2602.02572."}