{"as_of":"2026-08-19T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a90258f8b60f3ef2601f77b4cdd8452b43061d84db83c60889114947e82456c3","coverage":[{"denominator":114,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T07:05:47.150308Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02781/citation-record","integrity":"/paper/2607.02781/integrity","json":"/paper/2607.02781/citation-record.json","paper":"/paper/2607.02781"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:b0f6c0e008467f6db90b5cd31b7c0107430197a3ee2e58728c8ab9e1444075ff","observation_id":"9da458eb-b52c-4ac2-b292-155e7faa17bd","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Reinforcement learning from human feedback with high-confidence safety guarantees","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:de50e80826ac20ca064543c5c03b08c635d7c8cff5c29d4ab8c7d2de35299787","observation_id":"0aa7a822-3fba-4d90-96a1-1102fa05b8fe","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:4f0c98398da670c82e422807819dfda663767c437ba90aee9054d032411d82c6","observation_id":"9b49af43-32d3-4d2d-8341-b4f4af1349a4","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:a2c9d1679207729438b75691266b2b03b8d7fa5eb6a86b06a5c9905213ab8fde","observation_id":"e607e1d9-2c8d-4666-b6ca-0d86865bc024","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Realtoxicityprompts: Evaluating neural toxic degeneration in language models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:de85e3258475b777ffad21489714533fce3e1959824fabe050b5332e4134ba64","observation_id":"9792b898-8330-400b-ba73-f4504d012958","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:f890d271a32352166b695522fe685cbc59ae641a47b7b47c297f86efd5b6f17f","observation_id":"53f5a3e6-8d0b-4c12-a7ff-d8e037e255d7","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06639","last_updated":"2024-05-10T17:59:04Z","snapshot_observed_at":"2026-08-16T13:53:40.024766Z","submitted_at":"2024-05-10T17:59:04Z","title":"Value Augmented Sampling for Language Model Alignment and Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06639","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Value augmented sampling for language model alignment and personalization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2405.06639","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:e1cb6d2f05181c802c17fd80a58c2b09e3c395521fdf05205d74b4aa2390ee6a","observation_id":"d4c7758f-5e0d-4663-8a03-d149eaa72f8a","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:bd8cc066cd9c153dcb83434341a8d7cdd12276241ccf52c8af9e737921deff92","observation_id":"0c6b4f76-dca3-484c-b321-88e2c59f0f2c","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"u chemann, Maria Bannert, Daryna Dementieva, Frank Fischer, Urs Gasser, Georg Groh, Stephan G \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:7b280d7f96089110af818f9ed0824731b624b7aa46bf33977015efd4c64c1376","observation_id":"505efc81-efab-421d-a8f7-635d9ae5b8c6","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Gpt-4 passes the bar exam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:04b22673244eaf5d8e940adb874c991172b9eb0ba2931797f544f9b2d5d3cab3","observation_id":"42069561-8fc6-4f8f-9001-76b6f435a068","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Performance of chatgpt on usmle: potential for ai-assisted medical education using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d786fe1da7e4d668cd24bdf1f94b308821a0ad3f4de449ae07ea3cdd01805487","observation_id":"7d8303d2-9c00-42ce-a472-0a57a99f828a","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d23730399bf91b79d8ddf515f75976924b4b702b83acda21b171b8c2fe75e66e","observation_id":"2d446d9f-348a-4792-ba79-0f90a95426ac","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Foundation models for generalist medical artificial intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d927c46534764c59be9b254e8caf9c1f8818e6947ce0e26b2541b9267f66db64","observation_id":"a9742a86-e76e-48dd-9fab-6e9f1683e054","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-19T02:54:55.334346Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Webgpt: Browser-assisted question-answering with human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:9f1a3049d6b5e6ca2012654ea8a6ba37ba2574fac24caeb7b43406478a6da47b","observation_id":"5926ad6b-5045-4408-98fd-b7fa3df37392","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d51273e25cd69b3c66e6a5db90347963c4422b4d94aac11f403acb69eca51dfd","observation_id":"5efa0096-0a10-484d-8721-c8a63f30fe55","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00567","last_updated":"2020-03-18T09:54:55Z","snapshot_observed_at":"2026-08-14T19:40:34.002536Z","submitted_at":"2018-03-01T18:28:43Z","title":"Computational Optimal Transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00567","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Computational optimal transport, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/1803.00567","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:dab257c5cefa3ae6fc3d7e12f8a25f2d518253e7d8f4dbcb7ad14ff3bf228375","observation_id":"20885d27-65fc-40e5-8fc2-f1eb59ae16ac","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:a1b6104009f3d2496ee315cde892018046e7922e7d9c99da84fcd35a5cc5015c","observation_id":"ff819ac3-f356-4198-b8bd-6281f1551c1b","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:35588acba7bd2d9e673ff165550866db8fe94369045c18cafc10a2e5982d580e","observation_id":"daa32e7f-265a-4f51-9db8-ff02010ddb15","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:ed3b6798ca32b4ba357b8f64e26db5ea17b899c54fc80a7a2afcedfbd802a9a6","observation_id":"047a2ce5-9e24-4ccb-b222-72aa4d473dc6","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-17T15:45:31.564132Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:5ffa6aff918d50226c244e7a7f024a949984b9fbfc7d972aafd96b639c684fb1","observation_id":"58f19105-e644-4921-ac23-7b5e818bcaf5","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:09cc2d571568d25734b2102c30116aa2946b6f0ee25b006fd31ba3728c5c12e6","observation_id":"9bde22e4-842c-4a63-883b-4efd1083dea8","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Preventing undesirable behavior of intelligent machines","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:25cc1cd9bb96e4286f22d3f7fcd3f61dd39ba2f6458407636f234734f6453da3","observation_id":"230d259d-dcc9-411f-85bd-98fc39e9ef03","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Asymptotic statistics, volume 3","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:78991046c392e12e3b0ca5517bfc1c769d36789551e650d94c11ce2a5c383304","observation_id":"ea6a95d9-5d2b-4a5f-a090-4047da1d6258","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Fudge: Controlled text generation with future discriminators","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:03127f119c4a99407ac24f16f1623a35fbe93ce02a5a5822aae08893e4afb782","observation_id":"9d9dbe28-413f-43b9-8852-45f67f5ae41a","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"A large language model for electronic health records","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:8843c1df378e387ecffd7620d95c29487379aafa3b097c87788d1f9e041cf8f3","observation_id":"3741bc93-6ad7-4418-8714-f36688e3d59c","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17022","last_updated":"2024-06-03T20:50:26Z","snapshot_observed_at":"2026-08-16T14:48:48.486166Z","submitted_at":"2023-10-25T22:00:05Z","title":"Controlled Decoding from Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17022","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2310.17022 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2310.17022","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:f17e544e3e4eb5e128e342d816858f30d8119c695e37229a5eced481a9522052","observation_id":"ef73142e-dc4e-4369-a79d-a809b83272f8","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-16T19:20:56.486669Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:c4c63c301c0961d85a283ad5b760064e05491fcf5a471e9ae553032e787f1936","observation_id":"720b3ea0-fa45-4009-8487-9e6e6307be9d","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-08-18T11:13:23.191794Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2402.01694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:8e43db541380a6aff45846ca3c89b8c0b4d6634ba0df603c104e9df1ff357345","observation_id":"2aec05c3-0fba-4c6c-9285-d088541337c5","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d06bfc3b763d4debbb8d225e1418422b6e3231660e52ad113e7e37d20a4ef8f2","observation_id":"f550b1eb-c7b9-4e9e-83bd-8b6aaf3cf543","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2406.07780 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:4d4269cdf32c7b5901160f3a71349172535a3a596a7323ae6f4c8491c3d97fac","observation_id":"d5e009cb-0681-49f5-bc44-3f350a50e308","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:6e5bb9e0b08a6aa0b296d4009ab6eefe2d5a26239a130c2a4c0c57779a7ca5e4","observation_id":"f0a06b04-24da-43fb-87d8-d9b9e93f71da","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-11T21:47:57.647615Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04517","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2502.04517 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2502.04517","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:9c64a42139fb5066cb06a57e16191df6cd5173f14040be460499f15fbc2614d3","observation_id":"6c1f8641-65bc-4e7e-ab35-8ea5357eab5e","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-19T01:18:13.975742Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2310.12773 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:e30491c1b91823d86a16120cb4c90682cb37ed86aea2471232cbe1c3db9e2c59","observation_id":"f6e56e6c-5c43-41e2-b223-219f4a8d88c3","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:81686685ed4cc1a9fe4872684788e45fab6e620469cea49448b4b6a92adf4d84","observation_id":"6e7fad65-0ae2-4c1c-93dc-eb58b8674588","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:1910.00177 , year=","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:1aa0bde00a4457e9c99bbcd8bb0d3fffff0ecf241b19503597b5c2960574444e","observation_id":"9367313c-eca2-4354-bf35-b76bc7b54b5f","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:1522cdd230eede3221f71c4646a91316f1e287200623ba606f479ce378b586e2","observation_id":"a60d9eaa-f814-4b83-a7fc-25be22e1827a","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2505.20065 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:499ec86e389283fbbc33970e635651578ac00e23738a584470369927137768ae","observation_id":"907ea24f-379e-4c61-be29-b40805335096","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:69aba27d39d122aea920282269628968748a24e72bac89e886e9a39111b5ef97","observation_id":"c35ee9f0-f284-4cf5-96bd-62b2b9b289c0","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Attention is All you Need , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:43af23856a2972140cfae8e4254f6273f3f490f1f47087854cb777f7f4eb0f24","observation_id":"d7b632eb-0689-4b6a-942d-e3e3c079e7a8","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:4b77a0179e9b62d964564d15e8fd056f76ffa286d87742757422992598c201a1","observation_id":"fe1a0395-308c-46da-8445-ace778f66aae","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Constitutional","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:63cf487120bab3143eac3686d64c64ccc372a6b9ac17aacefa4a67dfcf88fa7c","observation_id":"5d2da1ad-5cc1-42e8-8bf7-a99121d33315","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:b32f63bfa6354673a57771a6ce7775fe2ea0197fb7b04436964a42378abb582c","observation_id":"b1db714f-f71d-48c5-96af-920be57ea4bf","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:5e3c1621405607f7443b15523eb50d3dc3c0ec4224f4aeb6f2816a14b9c1f32f","observation_id":"361396de-4449-4f63-87d1-dc1cb03b8c5e","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:b2c0a1206ffaeeafcca9feb6a688fa312be424a9d970aabb3ee2a71386c73391","observation_id":"214df456-f915-405f-b63e-e0ce3b13a9fa","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:60ed0940dcf72a44683e47a587a473cd6065f8bd925a160380e427b18d6a49ba","observation_id":"9abac8c3-d6fb-413a-905c-13dadac5ef1c","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2004 , publisher=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:98dc7a511b18de6f5a3378f69f671c4b2add3398d9e0c8e6551584eca440f40f","observation_id":"7f9e071d-dd10-4190-8816-72ada9c84431","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"University of Pennsylvania Philadelphia, PA , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:8c1ac7aeceef4d17744626cf0d96970318dd8f99ef8e333ff4d057a97819b9ef","observation_id":"9aea1f52-74fc-4b5c-b84f-8272f2ffd87d","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:8da7034d2bdb592f4b217727ef63db04bd7c217f5fd5cbb225c62968877b0c53","observation_id":"47e4a5e0-289b-4f09-a66f-81bca841d633","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Xing and Hao Zhang and Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:09dca1dcbb0ce148de4d6d707b6c03c30eeb78152595833d3bed71cfeab561dd","observation_id":"73655ecb-fb9b-414c-a1af-732ba84c79f9","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2021 , publisher=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:819a317f643a6eb63e21e209e4bc43dcc03ee9f4facac33537083ca5f079c9b7","observation_id":"eb5eca30-e387-4c5e-8fd7-d2536026b64e","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:2ada708520b54c067c4317173b64961d7a313e7a2d4532d81d74a8ecebe20b6d","observation_id":"310c0985-add4-4890-95ea-d9b53c909e8e","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:77e2024c1c00e35b688c0ab735bb4468e438625c1994144ab4fe2e140b92b383","observation_id":"7a76c9f8-9b72-4ba7-9925-856c56360029","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"DeepRLStructPred@ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:8e1dd9b900937ba795d1611ff375d25d8b521ef2e3b5c7af12c5a4f0da2cd0b5","observation_id":"d835919e-1879-4bbb-a9a5-307a672ccbb9","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:081a6f14136fe78c29fcce00bb9af6fb9c2f14b926077286e68dd79de1d33046","observation_id":"de5159fe-d2d9-49be-8490-d93380e2f3d2","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:ce176e168e74436319f8a9049c654de9a7393c9e034eeb4266921a4b25fadba8","observation_id":"d057888e-7068-4b20-9b6d-519e47f900f7","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:585a7364f5345b7b866d764ad9635f1ff9abf6d12481c6a845dcaea3bc1e4856","observation_id":"a2c044a5-cb3a-4229-ae84-bcc000a9ccc4","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Reinforcement Learning Conference , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:c2ae2fb5ad51fbe49cf814abf51243b4c74ed8b10bbe6c5ef861d623edf9c10d","observation_id":"1faf0388-5032-4bc8-b2d5-dbb831f31f50","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Science , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:b739455fa3eb9160455fc4f8aa82b542fab8093dc0f812e99b92113b4961c1e8","observation_id":"0d5bfc06-b01f-4a96-9118-ce2f6c6f113b","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:1f5f38a045363571028ff233e1cf402f87f7c075ed8e988a1928b9fc55b5ea98","observation_id":"d2f35738-4096-4e78-b60e-18feffe5c558","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:90a7b58e80ae382f61afff16b01f79a4eaab344882ee64515b7b7eeb2bb5dd0f","observation_id":"05582faf-a5bf-43bb-8810-3baa35fd28cb","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:6d6d46aa5808faa80ed2e3a6bb3d5982069a16247ab3517aeef89ddf43326d28","observation_id":"7e564baf-e1bb-49b3-9d3f-4cc53485eebd","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:b10c5737252cfa0443b122d8e4afc92eacfb442dcb154cf8865824f4057e5fd6","observation_id":"530afae8-312c-4c13-b16c-9e0e9de5baee","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:7fac62ce0603cf962e5b5baa2c97152aa76754332765c47372ecedc3b3ed1ee4","observation_id":"0c153b27-c814-4551-b60b-1a6b85bd1ad7","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems 32 , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:3c37fac8dd2f63c93404a4be800ebe814aa32743048ffefb7274e60690d53686","observation_id":"1b4fde2a-fd75-4a27-b39f-a4d0c45958af","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2015 , url=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:343759828f3050ae738c09c0023a9ae8eec4d030fc2bb3bf8566c78b15aa3a52","observation_id":"29b13f32-6b58-4867-ab65-0287c48c4fc0","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:a5af273d213978fa8d441f4144030fcea7aa1306f8559a9b13c67aee82f55d05","observation_id":"c926ba54-41d4-4601-b878-62193159a272","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Mathematical finance , volume=","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:e4ee710200c61c5e6e66b8747998c147cba774c3c02b0530654e42355862fbea","observation_id":"0deb4c19-711d-4eef-8ee1-c5f300cbca79","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Journal of banking & finance , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:f1fbd79b1d84914127b52e4350cf51d81ea2d805e902912579b82e78447093f3","observation_id":"efb6c590-e990-4a33-836f-579730425078","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in mathematical economics , pages=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:cfd690513bf680ecb1ae7801a9b5c3c623debe11451b7754f99bb6738284be76","observation_id":"b8efddcd-3f1a-46ab-9344-7e271bf6ec6f","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:5ba2b701fa50035de833e2af77def65403a66ecc230b08cf21176ffe1a6f237d","observation_id":"f4a7bbb3-29f0-48c8-a516-01647b42123d","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"NPJ digital medicine , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:6500b25675fdecf6705c49108ee785a7428a9d91eb6b6f00df19c8c0d5456215","observation_id":"296c4afc-b15a-4667-a0f0-ee848d81bbdf","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:2df9670dae07c3093bcf913bd7957cc750d4f1055f3c1aeebd2aff634ec529e1","observation_id":"2f2662d7-912e-42da-aa1f-d77d6d388b77","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:18e662b5e02e89a230c151a818aaba7706e27479f74140e63a545d232a29e044","observation_id":"9afab344-8328-4f29-ac24-47b42ebfe57e","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Learning and individual differences , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:e3d8d7a1e96bb7ec3f56404e7477a969c291ace248af5b2cf43eea9b18f24a65","observation_id":"9c446c8a-0fd7-40c1-842a-29a0cbb251a6","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"PLoS digital health , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:ce089f6a8002380bd822985c524238fea4ba8ea8df971723bba6174c0e455ef6","observation_id":"fbb2c9e3-b5df-4267-8737-b056a96ed6ee","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Findings of the association for computational linguistics: EMNLP 2020 , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:716321aa101db0d17a4293b16dbff480d17ebb33cf1a09e69bf169d62b1192bd","observation_id":"c9bfa319-ca37-45bb-b35a-181c63406882","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2112.04359 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:743a106e4b0fb251addf4eea174bd30984988e1de0d9238a6ebbb525c32ae280","observation_id":"a3a6a99a-eea5-4821-af82-89579f142141","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-17T08:35:42.452149Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2209.07858 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:62aa86c03362f5831cd0e992dcb12c880d5aed0b65d4cb4f3c6aa4b2dc3ed92a","observation_id":"ab8e2cb9-c229-401c-8a1c-fbaff14c01bc","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-08-16T09:29:21.586810Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2209.14375 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:f0eff6359b7ef5e06c62457556d4952fab728ef26b92c8337de9d5de53c44629","observation_id":"9d5b41cf-7330-4772-8969-f59b338a1c54","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:b381dd26598d88c9f76dd4572f67704e3effa5fba242acaf39b58c179d9dee11","observation_id":"b8a5cd61-f56b-4c45-9113-3d3198ab9ea7","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d309ddcf2de3a616abdcc079d06170681b84126b56e1432459342c7b417d5dbc","observation_id":"762eae1a-a72b-4322-a132-fec3aba6a9e4","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:a5ead1d6bd7b15b6d0f32f911bdfcc93d5d171e31547914267c8d75648c619cb","observation_id":"8d274b3b-eca7-459c-b17d-039d6ef0e25c","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:ef8bb06f185c62af684bc290447b0e12f317de554340bb333411c57bd7c1793e","observation_id":"76eb964d-0282-46ca-8756-bc4d523005b1","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2402.02698 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:4c6c5fc7e77899572ce3dd9bae05a55aa0d1ac50d512561a27fc045f8db0af90","observation_id":"ebfe296b-88ad-4f81-bcbe-1fa257ae7d75","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"SIAM Journal on Optimization , volume=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:f0cdba235943151d0142e1d3e6b4c1d7f6682946f3921bcde97f6f7bb1266fd2","observation_id":"78627b48-e129-4421-b1c5-1a0a53378d0d","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:472bcf343573c9dabe91bd2924d081e14d644d0782d174285a704cb5d1bbfbde","observation_id":"7ebf5663-7144-4179-9c4d-6a3ce6f9c4e3","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Proceedings of the 2018 AAAI/ACM Conference on AI, Ethics, and Society , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:4dcb4b3331a5b2a137f137bbe9fa1779b8a98deaeae5114536b2bf4bc934641c","observation_id":"575a54e8-9142-4164-9407-75ae23fb5830","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03451","last_updated":"2021-07-23T15:05:22Z","snapshot_observed_at":"2026-08-16T18:11:36.481806Z","submitted_at":"2021-07-07T19:25:57Z","title":"Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03451","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2107.03451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2107.03451","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:a9a265be58c834121cb048f744ad8b15b9343c5ddc56b2ec30564b5670e30252","observation_id":"c5aecd7d-65bd-48b3-ab38-abb4810f133a","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07079","last_updated":"2021-08-04T21:33:39Z","snapshot_observed_at":"2026-08-16T19:13:33.909491Z","submitted_at":"2020-10-14T13:26:39Z","title":"Recipes for Safety in Open-domain Chatbots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07079","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2010.07079 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2010.07079","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:0662a4fec9e6285343d2c443ab29cf0b1353611dad38037f07acc5fbae854e34","observation_id":"d377f38f-7567-4d7f-ac3b-92149dbfed5a","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2201.08239 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:add8b25078bbb070ff9698800b5af4dce770b287e9a135d81ff64b008551f172","observation_id":"0201cfc2-6dec-4ea5-8064-35b071820530","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01663","last_updated":"2022-11-10T01:02:29Z","snapshot_observed_at":"2026-08-16T17:02:50.902886Z","submitted_at":"2022-05-03T17:50:06Z","title":"Adversarial Training for High-Stakes Reliability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01663","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2205.01663 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2205.01663","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:ca79415a39d78d3f2cd032d868ca157396695f9a0ecd1feea14a41dc01557af7","observation_id":"30b11f2d-32db-41f4-a69a-f0936bd6d3e7","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-08-16T14:12:53.238076Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2403.02475 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:a52f4cdfb4ad6bff477ebf8eff10a3f438cc9acf933efb745096e8c5b8857e64","observation_id":"85cbb6ca-3aa2-4830-b59b-5f800a6df652","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:331099ff66c5f282b2f3a9e02505c9337241d8558ada4fba3356e6a44ae3639d","observation_id":"9e9d10ac-0873-4a31-919d-4531ce2957aa","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19933","last_updated":"2025-02-27T07:28:35Z","snapshot_observed_at":"2026-08-16T13:05:52.021628Z","submitted_at":"2024-10-25T19:08:23Z","title":"Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19933","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2410.19933 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2410.19933","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:5c47cc814c77c3db94330b7aef0e03fb2f5f1576f03a66bfafe976ea9b50f3e1","observation_id":"fbba9b50-535d-46a1-9911-52c57324de6d","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:da8020870dcbd781b8bc16969b4b29a89861b1517951b203ee7a41b49e27b71c","observation_id":"213c8880-eaa6-4fda-8b0a-975f0d8a7317","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15313","last_updated":"2025-04-08T11:04:33Z","snapshot_observed_at":"2026-08-16T13:23:25.714111Z","submitted_at":"2024-08-27T17:31:21Z","title":"Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15313","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2408.15313 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2408.15313","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:91e8c0f70e0dcd980d5c78ca4ddc2bcf3f5019e9cebc8fc128dc10d2b25a5bc1","observation_id":"9b5adc77-6d28-43f2-9e6d-1e8fccb9b27a","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:93c3cb8def4c25bad22b80658ae0091442299d64fa7e1d8d412e68750d9d37f3","observation_id":"dce02dfa-7e83-4f55-ac8d-445419b216a3","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11555","last_updated":"2025-02-17T08:40:30Z","snapshot_observed_at":"2026-08-16T12:57:49.810025Z","submitted_at":"2025-02-17T08:40:30Z","title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11555","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2502.11555 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2502.11555","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d77bea7f8c4de5d01189dedc7288d5cb0824dfd3aaf6e914ea47c55e194e749d","observation_id":"139e0b3d-c286-4974-a55c-b44b58c19d32","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:e522b6e0cab33cc98af3dba8eca0da66768f20bebfd0dcbe75dcf5cf964f8f37","observation_id":"7a6e7a13-ffe8-4162-888f-8aaa28ca0a9c","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:ba087ea4a0a1142935e6dbf70d5d3f1847652b93f23ed3cabc45f993fb41c449","observation_id":"6f5d8de7-1523-4c14-81a7-db5dc8e15b59","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T21:10:19.680500Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":114},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 114 outbound references and 0 inbound Pith citation observations for arXiv:2607.02781."}