{"as_of":"2026-08-16T22:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1c01f86a5353c665af072d6e0064e5c1d53e646ce7c1b8fcb00cf74e4e60321","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:13:53.754841Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:49.831725Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:02:54.459404Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"cited_work":{"arxiv_id":"2504.16272","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.16272","snapshot_observed_at":"2026-08-07T14:02:54.459404Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","venue":"cs.LG","work_id":"fb1010d2-62b9-46b0-8bf7-1c7ddb933160","year":2025},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.831725Z"},"links":{"cited_paper":"/paper/2504.16272","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:4f797e99d5540741b9253ea745c9bc93bc218c3c0a0177e0023a4d6901c2839a","observation_id":"923e16fe-d3d4-41ca-817b-2a72a70795c5","resolution":{"observed_at":"2026-08-07T14:02:54.542906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16272/citation-record","integrity":"/paper/2504.16272/integrity","json":"/paper/2504.16272/citation-record.json","paper":"/paper/2504.16272"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.432613Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.432613Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:629aeea59cafc53e335942943fbcbab96783debc8f4716afbc62133e9a99797a","observation_id":"be0da2d2-02ca-4c3d-a3db-62d5940f0410","resolution":{"observed_at":"2026-08-16T11:13:53.432613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.859816Z","title":"Searching for optimal solutions with LLM s via bayesian optimization","venue":null,"work_id":"c4090b63-3323-420f-888b-9552e457f55f","year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.440082Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:0ee25bffc00cf46d833a03c9b292e2ddab1a0871c9794500f10df6345efdd871","observation_id":"e2aa7bc8-7f03-4647-8dc1-d377fda7d9ef","resolution":{"observed_at":"2026-08-16T11:13:54.864857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20708","last_updated":"2025-01-07T13:11:19Z","snapshot_observed_at":"2026-08-16T14:47:06.742140Z","submitted_at":"2023-10-31T17:59:56Z","title":"Unexpected Improvements to Expected Improvement for Bayesian Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20708","snapshot_observed_at":"2026-08-16T11:13:53.445757Z","title":"Unexpected improvements to expected improvement for bayesian optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.445757Z"},"links":{"cited_paper":"/paper/2310.20708","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:94b06857eb804d056a3e22df370ed5bfecfae8ce57a2686a94c6f6221776c101","observation_id":"a5a0520c-5ccb-4251-8b39-c9a7f7d2d610","resolution":{"observed_at":"2026-08-16T11:13:53.445757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.451065Z","title":"Bayesian optimization with llm-based acquisition functions for natural language preference elicitation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.451065Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:a69b65d59e86294bb998dccdf422712b5505f8666fa2d3a094d0ef0a360df340","observation_id":"fb9fcc38-3381-4ca2-9f72-a4efe3d8e5e7","resolution":{"observed_at":"2026-08-16T11:13:53.451065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T11:13:53.456487Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.456487Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:d2edcea299007bf71a0810282bbb1078bd58126c9d0fe95a2dc07bdf921cc173","observation_id":"2d390c19-b550-42ce-9c64-b1316cb013b9","resolution":{"observed_at":"2026-08-16T11:13:53.456487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.843655Z","title":"Ae: A domain-agnostic platform for adaptive experimentation","venue":null,"work_id":"6d272ebc-04e1-417b-872f-0665c729129c","year":2018},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.461886Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:97c57354ef195e82a65923703f19331b7f5930b0775b3ed03af9bc01ead4ec30","observation_id":"15c65c35-49fa-4069-a33c-5103dcf29fc9","resolution":{"observed_at":"2026-08-16T11:13:54.849023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-16T11:13:53.467178Z","title":"Mechanistic interpretability for ai safety--a review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.467178Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:b426ce4d38dbcfe440f5da39bdd8f543c2a6c4c304b439d54087175e544bf38d","observation_id":"cc0f65d8-6b68-4d18-9f57-5b92b2a68c63","resolution":{"observed_at":"2026-08-16T11:13:53.467178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.477936Z","title":"Enhancing reinforcement learning with dense rewards from language model critic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.477936Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:1296c9fe90cefee17de69ceea387de21a186bfc1325eca74d02c9ad585e2ca3b","observation_id":"d5e0754c-e84a-4333-acba-9334c00391f3","resolution":{"observed_at":"2026-08-16T11:13:53.477936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-08-16T14:22:25.602627Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-16T11:13:53.482971Z","title":"Chan, Hao Sun, Samuel Holt, and Mihaela van der Schaar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.482971Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:cf5866d3a449ceb8ff63433b3f92599529342cf6f59d2e233541ddfc6485e0d4","observation_id":"0cf3d6ff-6d29-49ed-942a-da79774322f7","resolution":{"observed_at":"2026-08-16T11:13:53.482971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","snapshot_observed_at":"2026-08-16T14:01:23.195945Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08555","snapshot_observed_at":"2026-08-16T11:13:53.489068Z","title":"Rlhf deciphered: A critical analysis of reinforcement learning from human feedback for llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.489068Z"},"links":{"cited_paper":"/paper/2404.08555","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:406bb4e7709cca24b7b720bb1c84be9523d70cff14a109f861db8a312b30b63c","observation_id":"e10fba38-328f-4081-a0ba-ee9849d7764c","resolution":{"observed_at":"2026-08-16T11:13:53.489068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.827126Z","title":"I nstruct Z ero: Efficient instruction optimization for black-box large language models","venue":null,"work_id":"df120676-ef29-4257-a587-c7cdfe8cfa04","year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.494215Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:39668782de459e8c007b2847eece8ca5ec43eab63479afd3ad4185b27e2bd599","observation_id":"26ef8640-410d-4711-8656-5ae3060cda3b","resolution":{"observed_at":"2026-08-16T11:13:54.832327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.499367Z","title":"Improving large language models via fine-grained reinforcement learning with minimum editing constraint","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.499367Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:4dac00568a16258c4b2b444de2c6f748ee7461f7c80a78db90b02cbe65c66041","observation_id":"b500da87-2c39-4e7f-bdec-d37695cf0303","resolution":{"observed_at":"2026-08-16T11:13:53.499367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-16T11:13:53.504385Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.504385Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:cc0aad5a6817b35748912c3a9808d908ba0c4e66a17db85362767886e93f7af0","observation_id":"aed75ea4-28d5-4ad9-94c2-b3cc03dd2de7","resolution":{"observed_at":"2026-08-16T11:13:53.504385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07549","last_updated":"2022-06-03T17:43:39Z","snapshot_observed_at":"2026-08-16T17:21:06.938302Z","submitted_at":"2022-02-15T16:33:48Z","title":"Robust Multi-Objective Bayesian Optimization Under Input Noise","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07549","snapshot_observed_at":"2026-08-16T11:13:53.509845Z","title":"Osborne, Enlu Zhou, and Eytan Bakshy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.509845Z"},"links":{"cited_paper":"/paper/2202.07549","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:162fbd44b22ae031e3fa98950fa3bd3f31966425488cf618e160bf62ba0eadc8","observation_id":"fdae8e29-b113-42f9-8ed7-9feef875c404","resolution":{"observed_at":"2026-08-16T11:13:53.509845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09873","last_updated":"2023-10-22T20:28:18Z","snapshot_observed_at":"2026-08-16T16:07:30.352102Z","submitted_at":"2022-12-19T21:50:36Z","title":"A Comparative Study on Textual Saliency of Styles from Eye Tracking, Annotations, and Language Models","version":2},"cited_work":{"arxiv_id":"2212.09873","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09873","snapshot_observed_at":"2026-08-16T11:13:54.421125Z","title":"A Comparative Study on Textual Saliency of Styles from Eye Tracking, Annotations, and Language Models","venue":"cs.CL","work_id":"cfb28f35-5f1e-4228-8c88-68dcc399fcc5","year":2022},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.514916Z"},"links":{"cited_paper":"/paper/2212.09873","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:0266724c4f5a3de51394a1eb2e87c0af7ccede8a7241861dab91775f591b2c4e","observation_id":"d3ecf171-2a3b-488d-99d8-3b0ac85c3a84","resolution":{"observed_at":"2026-08-16T11:13:54.426948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-16T11:13:53.520216Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.520216Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:a21027cd5bc513fe553b63b6609cb0092c6eec56d258f9e91803dddc64e041f1","observation_id":"92fb10e7-d4b0-4506-9d89-ab0bc274e946","resolution":{"observed_at":"2026-08-16T11:13:53.520216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-16T11:13:53.525518Z","title":"Hashimoto","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.525518Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:77c3cd9f88cf10df217d1c2b57cc39e8cfc8ac6d801e8f54420b34d0e8c6be0a","observation_id":"36ab075a-59d5-49ae-8f89-c1c6a84ed3c1","resolution":{"observed_at":"2026-08-16T11:13:53.525518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-08-16T09:53:17.142851Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-16T11:13:53.530577Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.530577Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:dd1d5b14c8556b4c6a476899096fefc615555138edf8fbe3987ea28bb4a23b4c","observation_id":"8161ca46-facc-4825-bec4-0d5aa31e7eed","resolution":{"observed_at":"2026-08-16T11:13:53.530577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02820","last_updated":"2020-02-07T14:48:16Z","snapshot_observed_at":"2026-08-10T17:23:06.235767Z","submitted_at":"2020-02-07T14:48:16Z","title":"Noisy-Input Entropy Search for Efficient Robust Bayesian Optimization","version":1},"cited_work":{"arxiv_id":"2002.02820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.02820","snapshot_observed_at":"2026-08-16T11:13:54.346390Z","title":"Noisy-Input Entropy Search for Efficient Robust Bayesian Optimization","venue":"stat.ML","work_id":"d72f6298-cbb3-44dd-a091-52f648d3336e","year":2020},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.535933Z"},"links":{"cited_paper":"/paper/2002.02820","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:7d48ffacb43a759c208370d29e084bd3d65d0d3e444cd5447cdfe3fc8f272f9e","observation_id":"d9ee4086-abdb-4475-9efa-c687835bf8f0","resolution":{"observed_at":"2026-08-16T11:13:54.351519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-13T18:34:28.304602Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-16T11:13:53.541053Z","title":"Reward shaping to mitigate reward hacking in rlhf, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.541053Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:bd20bdcd4b4c3e2e606b9e22ddb304cce2a213bb62f94b0eba45232de75abdf5","observation_id":"69800bf4-61c8-44bf-a872-39ccbd9da377","resolution":{"observed_at":"2026-08-16T11:13:53.541053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-16T11:13:53.546227Z","title":"Scaling laws for reward model overoptimization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.546227Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:38e4b700568ff7f3141175b9d6ade37d750e85ab3347ab1bdb34d6adc9953a88","observation_id":"21c757cb-616c-4876-9e07-fb409d191222","resolution":{"observed_at":"2026-08-16T11:13:53.546227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.551640Z","title":"B ayesian calibration of win rate estimation with LLM evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.551640Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:398d88a2a4d5e39ee545fe0fd6ec3289c605f5f34e5f132bdb70d7c409336337","observation_id":"071fe415-b93d-4dff-a8e6-23b4a6091094","resolution":{"observed_at":"2026-08-16T11:13:53.551640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04072","last_updated":"2024-04-15T15:25:53Z","snapshot_observed_at":"2026-08-16T14:45:15.190206Z","submitted_at":"2023-11-07T15:36:40Z","title":"Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04072","snapshot_observed_at":"2026-08-16T11:13:53.556751Z","title":"Beyond imitation: Leveraging fine-grained quality signals for alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.556751Z"},"links":{"cited_paper":"/paper/2311.04072","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:b86125b7216c08ae81f0799d1c63b9ceb362161cbc90da74fe25f082eb6b55c5","observation_id":"5f8b3ec3-5902-41ba-ad03-94cc59b037b4","resolution":{"observed_at":"2026-08-16T11:13:53.556751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09579","last_updated":"2022-10-18T04:21:25Z","snapshot_observed_at":"2026-08-16T16:23:20.204209Z","submitted_at":"2022-10-18T04:21:25Z","title":"Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09579","snapshot_observed_at":"2026-08-16T11:13:53.561721Z","title":"Kakade, and Sergey Levine","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.561721Z"},"links":{"cited_paper":"/paper/2210.09579","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:1504edda2712b07528dc5e2da295bb2d749980c111f0aad64e52818530e5f53e","observation_id":"f9852ba3-ac7b-4ce6-af06-9581434901ab","resolution":{"observed_at":"2026-08-16T11:13:53.561721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03884","last_updated":"2025-05-30T04:56:02Z","snapshot_observed_at":"2026-08-14T02:18:54.465541Z","submitted_at":"2025-01-07T15:46:42Z","title":"AlphaPO: Reward Shape Matters for LLM Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03884","snapshot_observed_at":"2026-08-16T11:13:53.567250Z","title":"Sathiya Keerthi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.567250Z"},"links":{"cited_paper":"/paper/2501.03884","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:abda7bd7e390b5cf8cd1e3a50c0fc0c00aa156cd3165e764fc2d4264aa17a685","observation_id":"fa33791a-c2a0-4da9-9ab5-c14e48d45fcd","resolution":{"observed_at":"2026-08-16T11:13:53.567250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.02738","last_updated":"2021-11-12T13:49:00Z","snapshot_observed_at":"2026-08-16T17:58:29.038223Z","submitted_at":"2021-09-06T21:01:17Z","title":"Does BERT Learn as Humans Perceive? Understanding Linguistic Styles through Lexica","version":2},"cited_work":{"arxiv_id":"2109.02738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.02738","snapshot_observed_at":"2026-08-16T11:13:54.240855Z","title":"Does BERT Learn as Humans Perceive? Understanding Linguistic Styles through Lexica","venue":"cs.CL","work_id":"232bfc74-c560-4a9f-aacd-5e0717e5ddb4","year":2021},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.572878Z"},"links":{"cited_paper":"/paper/2109.02738","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:686677f9535af6046dd8a93b9a3e82be658b6479b947ad21005f8d02624d8256","observation_id":"d38521f6-a144-43f4-a909-2adc236dddbf","resolution":{"observed_at":"2026-08-16T11:13:54.246578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.809092Z","title":"Learning to utilize shaping rewards: a new approach of reward shaping","venue":null,"work_id":"cee01d32-87d9-43ef-a64e-01f1ad8091c9","year":2020},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.578414Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:285a2aef722583b64bb5470a9ab0bd30f98d147b343948623ec995f07ba3460a","observation_id":"ff39b7f4-85c4-408c-a901-46bbb42e1719","resolution":{"observed_at":"2026-08-16T11:13:54.815112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.583131Z","title":"Training language models to generate text with citations via fine-grained rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.583131Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:fb0e086923d79154be32cd5481eda8aabd3195269702b1ff20148ce8dceb4980","observation_id":"19a18418-60e8-44fb-a9e4-b9e688865705","resolution":{"observed_at":"2026-08-16T11:13:53.583131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10186","last_updated":"2019-05-08T18:05:56Z","snapshot_observed_at":"2026-08-14T17:10:45.602687Z","submitted_at":"2019-02-26T19:59:15Z","title":"Attention is not Explanation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.10186","snapshot_observed_at":"2026-08-16T11:13:53.588294Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.588294Z"},"links":{"cited_paper":"/paper/1902.10186","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:08de3f2cf27bce72f9eeafe437a014ed6ed56c0ddfb7b43bb6db59fc5e12191c","observation_id":"b16c611c-2df7-4e78-af0a-a24931d6131a","resolution":{"observed_at":"2026-08-16T11:13:53.588294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.791481Z","title":"Align to structure: Aligning large language models with structural information, 2025","venue":null,"work_id":"d1f613e7-b907-491c-93ab-84bff8259a30","year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.593497Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:86b2d63b376a063cae9427d8df45f99b7bed77308789876675ed4ac488dff06f","observation_id":"e51f7903-74d5-42bf-94a4-8643b79fdadc","resolution":{"observed_at":"2026-08-16T11:13:54.796657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.775242Z","title":null,"venue":null,"work_id":"576bdb14-7ee1-4c77-84fb-d4dede7328ca","year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.598264Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:6e39ddd19f13b2e09e0ae6026d0fe6972022cebc8de32c0899c5cd43c3c206c4","observation_id":"0ae909f1-dbc3-4b54-86f6-7cf6d7f79335","resolution":{"observed_at":"2026-08-16T11:13:54.780298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-59710-8_77","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.822532Z","title":"Dvornek, Yufeng Gu, Pamela Ventola, and James S","venue":null,"work_id":"6a0db9e4-6906-492f-8bb8-944ecd4a61de","year":2020},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.602872Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:d4b30a42bf799dde0156048b9d7e4e6b10f92d5f98f5d0eb4d0398d9941591ee","observation_id":"4f831392-b562-4fb1-a6c7-26c59520b9f3","resolution":{"observed_at":"2026-08-16T11:13:53.828167Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-16T16:02:23.201218Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-16T11:13:53.608027Z","title":"Let's verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.608027Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:0f22ff4da0cda5c70c82842711fe466c950e08b816656223265055177b15c281","observation_id":"16dc7879-2c2f-4fbc-b71b-039cffff9138","resolution":{"observed_at":"2026-08-16T11:13:53.608027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.758201Z","title":"Checkpoint merging via bayesian optimization in llm pretraining","venue":null,"work_id":"0cdd2401-2cb1-4118-983d-796c75633e95","year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.613242Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:67ada1755a6b8de4fdc858a20fa1c79e999f3da6efbf26193e5a08bc3d837201","observation_id":"49d47933-772f-474f-9707-fa99e5495927","resolution":{"observed_at":"2026-08-16T11:13:54.763841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.741551Z","title":"Choosing the sample size of a computer experiment: A practical guide","venue":null,"work_id":"0e374e12-835a-4b4a-aad9-608227f8ec34","year":2012},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.617851Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:2f27e8f60555b1622b46d1814d8ac97dbb7b49092ba0bd42ea1c13bc9da6a978","observation_id":"bb2370b8-cd47-4f7c-a2be-8432c0dac0d7","resolution":{"observed_at":"2026-08-16T11:13:54.746849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.724723Z","title":"A unified approach to interpreting model predictions","venue":null,"work_id":"1ef79517-02b4-49eb-9f18-f59226d80e58","year":2017},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.622521Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:c98e758613f7173abfe5afda122a665480a941f13f0e2142d95220630a8f749c","observation_id":"07e59041-b32c-451a-926b-d56a822a30a5","resolution":{"observed_at":"2026-08-16T11:13:54.729881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10100-009-0100-8","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.803408Z","title":"López and Martha Saboyá","venue":null,"work_id":"88e97786-ac6b-4fc7-b001-d40b4ac6681f","year":2009},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.627449Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:0539490ed13e12d8a06a6ce942c5612038c6029505eddb371afdd4187c51c796","observation_id":"3712e313-8501-4ba4-af98-92ea12a111b0","resolution":{"observed_at":"2026-08-16T11:13:53.809530Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.632376Z","title":"Ng, Daishi Harada, and Stuart J","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.632376Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:aa05d9b137cdb3d79b908e8b65f9d11d787f7a065fecbc1c54228e6cd0546fd4","observation_id":"ff7ced17-d3d7-4bb5-8c47-d83c83e8a7c6","resolution":{"observed_at":"2026-08-16T11:13:53.632376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.637185Z","title":"Optimizing instructions and demonstrations for multi-stage language model programs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.637185Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:e4b1f326901ebe52719b5f8a290dd31111209a125a3fc789cd6e4d82aaf84e14","observation_id":"9d809bea-52bd-4d59-af78-2133dc328e01","resolution":{"observed_at":"2026-08-16T11:13:53.637185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00722","last_updated":"2024-11-01T16:36:14Z","snapshot_observed_at":"2026-08-16T13:03:44.489678Z","submitted_at":"2024-11-01T16:36:14Z","title":"Token-level Proximal Policy Optimization for Query Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00722","snapshot_observed_at":"2026-08-16T11:13:53.641848Z","title":"Token-level proximal policy optimization for query generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.641848Z"},"links":{"cited_paper":"/paper/2411.00722","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:9ba330d733543358810cad1fa8cdb75608f4835b5b99f301260468ecebc5cc3a","observation_id":"d76c6724-72a8-40b7-bd7c-a561ccbe78c7","resolution":{"observed_at":"2026-08-16T11:13:53.641848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-08-16T13:59:41.097676Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-16T11:13:53.647127Z","title":"From r to q^* : Your language model is secretly a q-function, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.647127Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:68ac320f6a9784470bddb1cfce143617383cbef1b35657eea0342d19117b4e4b","observation_id":"bf6547e5-2a7c-42c0-a919-fb03946209ea","resolution":{"observed_at":"2026-08-16T11:13:53.647127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20703","last_updated":"2024-03-14T08:05:18Z","snapshot_observed_at":"2026-08-16T14:47:06.873463Z","submitted_at":"2023-10-31T17:59:05Z","title":"Vanishing Gradients in Reinforcement Finetuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20703","snapshot_observed_at":"2026-08-16T11:13:53.652373Z","title":"Vanishing gradients in reinforcement finetuning of language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.652373Z"},"links":{"cited_paper":"/paper/2310.20703","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:4514537280914177274d454c12eb93d52d489258dcced1c6e0e88138512b868b","observation_id":"b0101030-01d9-421d-8a35-a662453e089f","resolution":{"observed_at":"2026-08-16T11:13:53.652373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.04938","last_updated":"2016-08-09T17:54:52Z","snapshot_observed_at":"2026-08-14T22:10:11.360520Z","submitted_at":"2016-02-16T08:20:14Z","title":"\"Why Should I Trust You?\": Explaining the Predictions of Any Classifier","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.04938","snapshot_observed_at":"2026-08-16T11:13:53.657392Z","title":"why should i trust you?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.657392Z"},"links":{"cited_paper":"/paper/1602.04938","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:1f773266124265084151a7ad6bdc974b179142a5b1bc956795949a91efb50e15","observation_id":"8d3a9fe6-74ed-4604-8fd6-8bb6c2d72a41","resolution":{"observed_at":"2026-08-16T11:13:53.657392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:13:53.662760Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.662760Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:7636ac693e2d78655ad0346674f5db45abcfa31955b3e0d026da6ee638241599","observation_id":"6640c93f-2c79-4efc-b5be-ef0233c98c4f","resolution":{"observed_at":"2026-08-16T11:13:53.662760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06886","last_updated":"2024-06-01T02:41:07Z","snapshot_observed_at":"2026-08-16T14:19:42.615195Z","submitted_at":"2024-02-10T04:54:15Z","title":"Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06886","snapshot_observed_at":"2026-08-16T11:13:53.668079Z","title":"Principled penalty-based methods for bilevel reinforcement learning and rlhf, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.668079Z"},"links":{"cited_paper":"/paper/2402.06886","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:e933ef85d29fecc410d4ba4059e4e0a467d0b36c546e7125c9039edce6398e8e","observation_id":"893e5ac8-0439-4968-98f4-9431b38b94b5","resolution":{"observed_at":"2026-08-16T11:13:53.668079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.2944","last_updated":"2012-08-29T06:36:23Z","snapshot_observed_at":"2026-08-15T00:56:56.579377Z","submitted_at":"2012-06-13T21:23:15Z","title":"Practical Bayesian Optimization of Machine Learning Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1206.2944","snapshot_observed_at":"2026-08-16T11:13:53.672974Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.672974Z"},"links":{"cited_paper":"/paper/1206.2944","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:6da68a0b275543ba728f18e95864024fd01439fe04e90af8c265a9d5d9d04f26","observation_id":"240ed774-ab87-43bb-b7e8-f10721d1bd13","resolution":{"observed_at":"2026-08-16T11:13:53.672974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.678405Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.678405Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:da459c76d9f0a8e66dadd9a4d37450eec3049d3e673bef775b72a0469d0388fc","observation_id":"8185d6af-748d-456a-bfd7-838dc0ef45a8","resolution":{"observed_at":"2026-08-16T11:13:53.678405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:13:53.683188Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.683188Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:4467aca8b9defaf7e23e7135f99a72a85917eceaaecb8476e0960fe062e8a65b","observation_id":"924813ae-32c8-4ac8-9beb-546af64e8672","resolution":{"observed_at":"2026-08-16T11:13:53.683188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-16T11:13:53.688401Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.688401Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:59723e91a260c57c5681fcc6acf8790f13eae5d535a59f14c7a554aa24b2dea1","observation_id":"09b66e02-8d0e-4e46-9e1e-9d0b9ce44ba2","resolution":{"observed_at":"2026-08-16T11:13:53.688401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.693486Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.693486Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:5140b72c34bf9ab3ab3c1cdd31da2de787553f77fd1ef17181803b58fe152511","observation_id":"14fca40d-d3cd-49ad-a4c6-cfb0410a079b","resolution":{"observed_at":"2026-08-16T11:13:53.693486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01693","last_updated":"2023-10-30T06:34:35Z","snapshot_observed_at":"2026-08-16T15:27:03.249856Z","submitted_at":"2023-06-02T17:11:37Z","title":"Fine-Grained Human Feedback Gives Better Rewards for Language Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01693","snapshot_observed_at":"2026-08-16T11:13:53.698400Z","title":"Smith, Mari Ostendorf, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.698400Z"},"links":{"cited_paper":"/paper/2306.01693","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:d9e0d680df3c1e22f5f60e4b7ac197bd236bd99732357e738699799710310ba3","observation_id":"b8be739a-47c1-491d-9a4b-64c8c36d1227","resolution":{"observed_at":"2026-08-16T11:13:53.698400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-16T14:59:02.373142Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-16T11:13:53.703608Z","title":"Text2reward: Reward shaping with language models for reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.703608Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:13c7f11e20d74fe8a5749dfddddcc82e4f92587f932c8e6cb28bdf1823c804b1","observation_id":"1757d1cf-61d8-4ada-9e0c-f1774b93a150","resolution":{"observed_at":"2026-08-16T11:13:53.703608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.675833Z","title":"Bayesian reward models for llm alignment","venue":null,"work_id":"8ba8c2ca-07da-412e-96fb-779f0bed0fa2","year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.708866Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:96820ad4b1b1e570d581e770560d3e092c22caeaeacfcd0c27707c53f5a2f02d","observation_id":"f387338b-f995-4df2-8be2-8cc04e0e53b2","resolution":{"observed_at":"2026-08-16T11:13:54.681298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.658551Z","title":"Tlcr: Token-level continuous reward for fine-grained reinforcement learning from human feedback","venue":null,"work_id":"d4a54182-e9a9-449f-aa71-ecaf41ee6527","year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.713467Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:caa4b66bc195b462700203f65bdb88cc33e709ff5fabd56c094f5ff0f7add1e7","observation_id":"da0bccb0-6288-4891-90e1-995df1dfcd19","resolution":{"observed_at":"2026-08-16T11:13:54.664323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:54.642371Z","title":"Token-level direct preference optimization","venue":null,"work_id":"3e70adb2-b789-4052-9d34-2b83454a94ca","year":2024},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.718102Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:10bb68157954ad772cf8d1dc65df88cc7d341b2b3814e235bf4d9a319e78157e","observation_id":"4c7b430a-b5cd-4705-86c5-900022d99dfc","resolution":{"observed_at":"2026-08-16T11:13:54.647415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00788","last_updated":"2023-12-20T20:30:24Z","snapshot_observed_at":"2026-08-16T15:11:31.013833Z","submitted_at":"2023-08-01T18:59:07Z","title":"An Introduction to Bi-level Optimization: Foundations and Applications in Signal Processing and Machine Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00788","snapshot_observed_at":"2026-08-16T11:13:53.722905Z","title":"An introduction to bi-level optimization: Foundations and applications in signal processing and machine learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.722905Z"},"links":{"cited_paper":"/paper/2308.00788","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:b99e2e7e3582deddea46f8320142be3e4b2adcfe7cf2dfb4f638332e948a9cdc","observation_id":"343a2e57-0c8c-4d85-a8d1-03d312a63d27","resolution":{"observed_at":"2026-08-16T11:13:53.722905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-16T11:13:53.728896Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.728896Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:37833980f4627ed9dc753bf34c7a79d9237c7f7dc069b06ac5267ac566f54c4f","observation_id":"dcab4207-4662-4744-8371-55243852e5c2","resolution":{"observed_at":"2026-08-16T11:13:53.728896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-16T10:37:13.463130Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-16T11:13:53.734394Z","title":"Secrets of rlhf in large language models part i: Ppo, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.734394Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:698f5055ddcc5fb9f26c103a648337c137c6b702d3a02384961975ea66ba5fde","observation_id":"aa4cbb0e-1b32-42ba-91b7-8c444343372b","resolution":{"observed_at":"2026-08-16T11:13:53.734394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-08-16T17:38:22.018669Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-16T11:13:53.739536Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.739536Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:831c16e14ec215268571c7b4ee0fe03ae8dd037c3e3e95fb806ca618e3e86f6d","observation_id":"1dc7d0db-9095-4dc4-bb4b-a1b3ed8c2c08","resolution":{"observed_at":"2026-08-16T11:13:53.739536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.744755Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.744755Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:52cae8d4149bc93e658e7f020a788e544403ed82ec41d34aa95ae7f6c4e0d6c9","observation_id":"6d3e2307-1506-41eb-ae9e-126c16d9f2a9","resolution":{"observed_at":"2026-08-16T11:13:53.744755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.749803Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.749803Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:603707ebb5d7d55ca0a72157908a9b9ec30e72656c295ed11a4f24b450b98c00","observation_id":"4531159c-9783-4a26-a212-d2345a7584ef","resolution":{"observed_at":"2026-08-16T11:13:53.749803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:13:53.754841Z","title":"reward shaping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T11:13:53.754841Z"},"links":{"citing_paper":"/paper/2504.16272"},"observation_digest":"sha256:f5536a8dd4f7c51ea08c657389e5bade5cdde0004c7941f34875caca27e3a3d0","observation_id":"a1fc9a04-f739-4ead-bd27-43f969e7b283","resolution":{"observed_at":"2026-08-16T11:13:53.754841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:39:00.881138Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":5,"verified_fuzzy":11},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2504.16272."}