{"as_of":"2026-08-08T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b551361be94dbccf4148dd290f3ac1f410f127047f6a6803b9346e5b0d11e0b3","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:16:43.217090Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T03:41:52.859647Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T03:45:17.571390Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"cited_work":{"arxiv_id":"2506.08681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08681","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating reward over-optimization in direct alignment algorithms with importance sampling","venue":null,"work_id":"89cf9ee3-8638-44d0-a88a-a84f29518323","year":2025},"citing_paper":{"arxiv_id":"2605.23398","last_updated":"2026-05-22T09:11:20Z","snapshot_observed_at":"2026-08-02T13:58:02.707128Z","submitted_at":"2026-05-22T09:11:20Z","title":"TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T03:41:52.859647Z"},"links":{"cited_paper":"/paper/2506.08681","citing_paper":"/paper/2605.23398"},"observation_digest":"sha256:f3de7166b79747d0be735b998ba6e5aaa337bd7354b814fa33043c0d66fe3782","observation_id":"e1f65f80-3589-45c1-a711-d6626b6e7187","resolution":{"observed_at":"2026-05-25T03:45:17.573771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08681/citation-record","integrity":"/paper/2506.08681/integrity","json":"/paper/2506.08681/citation-record.json","paper":"/paper/2506.08681"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-07T05:16:43.181106Z","title":"12 Preprint Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.181106Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:648dddee7eed594d46ec3a6c10fd12c0f7488c755b9203119cbb1caa224de76b","observation_id":"a0f685e8-a465-468b-a58f-4832787db942","resolution":{"observed_at":"2026-08-07T05:16:43.181106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T05:16:43.185377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.185377Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:570b02c585be8290379d5da7e7334911419f9c9e3fd862eaba1a2959db7b7928","observation_id":"258e424f-f7ff-40c9-a1f4-26cfa3be0f3d","resolution":{"observed_at":"2026-08-07T05:16:43.185377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T05:16:43.189540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.189540Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:30e946ecfd0368a75315df3b291cd491034601c442f5e2dd9d4668f92f11b844","observation_id":"4d66ed61-f61e-490b-ae51-adb4cca2b999","resolution":{"observed_at":"2026-08-07T05:16:43.189540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T05:16:43.197365Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.197365Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:a24ec9d953176cc3bffce382f49d23bb2a05376bba6d3858907768230ec6b630","observation_id":"2ecd451f-e590-4233-8ca6-48f70ef5035f","resolution":{"observed_at":"2026-08-07T05:16:43.197365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.374498Z","title":null,"venue":null,"work_id":"9ba07b25-1d88-40d9-a8d4-9ac7729a1d3f","year":2022},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.201513Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:6ca2a7b16bf1b77bc02dba7fe005e890c918d65f7db5e6f5d0072ce0f600e6b2","observation_id":"f2f2f166-723e-4ae7-9a6c-85d85b5b8c91","resolution":{"observed_at":"2026-08-07T05:16:43.378995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:16:43.209489Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.209489Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:ee75e6d433fb88a6b23b3e7d68a954101d642b2849212d1d245c6fe6b682451e","observation_id":"847a3684-3bc7-45c9-9457-2fc086b44a42","resolution":{"observed_at":"2026-08-07T05:16:43.209489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.349280Z","title":null,"venue":null,"work_id":"a8101aca-f21f-4977-8226-35cd9e54d823","year":2020},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.213207Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:d3be46eda6dd40404a1afb81ae1eb9c4655a2d9273853794630c545c0ad39f9e","observation_id":"b43310e1-adb9-47f2-ba3b-74fa4eb505fe","resolution":{"observed_at":"2026-08-07T05:16:43.353429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.334370Z","title":"gpt-4o-mini","venue":null,"work_id":"e3f01963-b40b-4895-8ae6-40ae87ee70ca","year":2022},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":640,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.217090Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:44853317aab24d33ddee08efec1dddf6e9f7086bc26ff891f6bed6f2d11ef9a4","observation_id":"9c79d974-d0d4-4636-9e46-2afef4379b97","resolution":{"observed_at":"2026-08-07T05:16:43.340209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.400268Z","title":"cc/paper_files/paper/2017/file/d5e2c0adad503c91f91df240d0cd4e49-Paper.pdf","venue":null,"work_id":"5947257c-4a78-4ff8-aae8-3913bc6c7919","year":2017},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.171719Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:10f35f2a0242b69aded25bb75f1236b95a34fb2d0d945648a8509a24f848df4f","observation_id":"6c2a0880-c598-4a3f-b7f5-1f9f2cf431ed","resolution":{"observed_at":"2026-08-07T05:16:43.405220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.387218Z","title":null,"venue":null,"work_id":"013e030d-cb31-4fa3-914a-63226d04e2b4","year":2020},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.193528Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:9ca354e95ca2f29b15d9e2ba31fc8fd289c1cc41fa928518dc86c5d6ec50f31a","observation_id":"a77382f5-edcc-4ce8-af9b-2e9f9ac1bef2","resolution":{"observed_at":"2026-08-07T05:16:43.391070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.176803Z","title":"doi.org/10.1002/9781118445112.stat08284","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.176803Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:05c6f3eb4cc19966d9282d3c22446d76f7f3b0a7992a8951eb92160e3a3cd0f6","observation_id":"220cbbf9-df1c-41a9-9a11-0e648098282f","resolution":{"observed_at":"2026-08-07T05:16:43.176803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:16:43.162886Z","title":"2204.05862","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.162886Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:bdabed7b1d97dc8fddd7d17c3af5d646160b20bec3953608b561f905be8d96d8","observation_id":"a041404c-0989-4b13-b3a2-30e20740b42a","resolution":{"observed_at":"2026-08-07T05:16:43.162886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.361890Z","title":null,"venue":null,"work_id":"73de23bd-4129-4a0d-8d22-8e83145af579","year":2024},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.205323Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:facb3aefb9300659c4d5600a0fd56c9dbbd9755c1cee1d6d0ca9c13a466d0883","observation_id":"4a290447-6663-444f-9ffa-cd2c74a00af0","resolution":{"observed_at":"2026-08-07T05:16:43.365925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:16:43.157955Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.157955Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:949d016704d1ac8d98693a146744f05b88a90688f338b3c91eaf9754290ab10e","observation_id":"e92b9e93-09fb-4fc7-a05a-db9669aceec6","resolution":{"observed_at":"2026-08-07T05:16:43.157955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.413296Z","title":null,"venue":null,"work_id":"2d61be8e-312a-4b85-a3f1-1415027a1222","year":2024},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.167292Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:c64f6796bb126c1ce076d571febad0e6f20e3b0df2e27c47b4f5e5a8242c5f1f","observation_id":"d41e3211-0888-4820-835d-ee00b26f148a","resolution":{"observed_at":"2026-08-07T05:16:43.418032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:02:23.109697Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2506.08681."}