{"as_of":"2026-08-13T06:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa8d31bb65698a08967e45a6d1c9c33df7461a3c10ce6630549aee467e2a5d5a","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:15:47.969050Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12843/citation-record","integrity":"/paper/2411.12843/integrity","json":"/paper/2411.12843/citation-record.json","paper":"/paper/2411.12843"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.761360Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.761360Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:f403e0dd22803cd9cf7e00f4f4ea56e4dea65d2b37071fa831b8e0d845e74272","observation_id":"4e161b2c-34e3-4133-a110-a5e585e1f317","resolution":{"observed_at":"2026-08-12T17:15:47.761360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.767020Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.767020Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:5d474d3def30722258c73a967953545c0bf4485809608f86a5676c0cd6bf20ed","observation_id":"a25c7f74-9667-4f33-b6fb-4c84c54ce535","resolution":{"observed_at":"2026-08-12T17:15:47.767020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.566694Z","title":null,"venue":null,"work_id":"dcc2071c-97f3-45c0-81f4-f29f46132dff","year":2011},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.771511Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:021b7dcdd764000707d398075922fbc512ef713820e94b1b39e828b2b3d8aac2","observation_id":"081e54fb-3acf-418c-be61-60cf8a58c732","resolution":{"observed_at":"2026-08-12T17:15:48.570039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-08-13T04:17:42.432949Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-12T17:15:47.775855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.775855Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:68b696cf183f3030ecb9406bf015b2cad29e74d1936a5b43febb70fbc6695b3f","observation_id":"3691b473-c2fe-40e0-9867-c3f02393bc96","resolution":{"observed_at":"2026-08-12T17:15:47.775855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-12T17:15:47.780377Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.780377Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:e9ff5ffe6239e311d7c9e2ba827319af328731c775714b5991de23fb46fe6219","observation_id":"ec021049-0eab-49c7-b308-445dbea10f05","resolution":{"observed_at":"2026-08-12T17:15:47.780377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.557874Z","title":null,"venue":null,"work_id":"d51c3b9c-723d-4178-b745-d540e47968cb","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.784982Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:ddf42b23e5f6b8960a6f4daee1972dce77f6c88cfd623a6260f8f22dcb75ed48","observation_id":"bf53b892-14f2-425c-a9a3-ab687e1ea5ec","resolution":{"observed_at":"2026-08-12T17:15:48.560838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.547756Z","title":null,"venue":null,"work_id":"d1104eb9-5c68-4142-ba01-931d2debf213","year":2014},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.788433Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:cb67d88f3075d873c79dcbce6d3553ed51f08208fc4252a9731d2d92e566d067","observation_id":"b6c3f1fc-d1d5-437e-89cb-e94123dd7724","resolution":{"observed_at":"2026-08-12T17:15:48.551619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T17:15:47.793228Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.793228Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:87a9b365355819d17ea3227c7e31639a4c3bbb0a71412746ec192e752c60e645","observation_id":"40253885-eda4-42bb-897d-6536a1eb4854","resolution":{"observed_at":"2026-08-12T17:15:47.793228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.797841Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.797841Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:4592342b722c9d6b82e8fa3fed6703664457365ba6118c00b05e93305443d791","observation_id":"6d254da8-a3c7-41f1-97e3-76f4752b190d","resolution":{"observed_at":"2026-08-12T17:15:47.797841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.531545Z","title":null,"venue":null,"work_id":"9d17d14f-630e-4058-91e3-b8a5ceba5b3c","year":2006},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.801861Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:1d1782ecf125f57f18b8b506c2a34b5875b36a1dae0698cc3d234d26f2a17661","observation_id":"2ef17b6b-f8b7-4189-ab8b-30825ccca466","resolution":{"observed_at":"2026-08-12T17:15:48.535395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-08-13T04:19:22.554159Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-12T17:15:47.805929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.805929Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:cbc1ca73c16ccf56e67be472c45214939f44f298c5b0bf1295d504e9b4f55c9e","observation_id":"3d06af9e-fbb3-4650-ac11-200bed482f14","resolution":{"observed_at":"2026-08-12T17:15:47.805929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.810658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.810658Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:d613a73f015e638cbd57e33fbee6370ce54a0e0c01c41a2288ec94ee2506968c","observation_id":"70a8b507-2a26-45ac-9373-33f3a7df35a0","resolution":{"observed_at":"2026-08-12T17:15:47.810658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.519733Z","title":"u rnkranz, Eyke H \\","venue":null,"work_id":"bb93f594-e67c-4227-a1fc-d84937bff11c","year":2011},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.814466Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:ca3c913576b9d97774547636a1a3206b2917aa4354c4840da60466240dcbe7f1","observation_id":"d935d9db-872b-4b7f-96cc-af7637e00f58","resolution":{"observed_at":"2026-08-12T17:15:48.523675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01752","last_updated":"2020-01-15T07:19:09Z","snapshot_observed_at":"2026-07-30T10:08:52.387254Z","submitted_at":"2019-07-03T06:15:14Z","title":"On the Weaknesses of Reinforcement Learning for Neural Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01752","snapshot_observed_at":"2026-08-12T17:15:47.818566Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.818566Z"},"links":{"cited_paper":"/paper/1907.01752","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:2b4bde0740a543ca547576e6f8f9c74da7fb896fbaa9daa948021c78247bdf97","observation_id":"1a394c47-48e2-4352-b8af-e43e3388513e","resolution":{"observed_at":"2026-08-12T17:15:47.818566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.509294Z","title":null,"venue":null,"work_id":"e70b2e0c-7fe5-4f34-8dde-cf8ad5bb25d5","year":2017},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.823139Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:2e246d0c17da5162e64994755550f77450633b2c731cb2475274e51cb79a77c1","observation_id":"152af994-d48c-4e32-975f-2259477455ae","resolution":{"observed_at":"2026-08-12T17:15:48.512901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-12T17:15:47.827057Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.827057Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:792058334e59ee440c83afa20479a55b4c4119a6510e127adc2dcead488d7f7e","observation_id":"b4e678f4-cd4b-47b1-be74-b7f539c50a42","resolution":{"observed_at":"2026-08-12T17:15:47.827057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.499358Z","title":null,"venue":null,"work_id":"10f58ccd-da75-4425-82aa-c89909d10df5","year":1970},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.831232Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:aa6e12959ac9166f07ea4122d5af7787a9daa5c3e5dffb19c1f47fc0b4d1f4df","observation_id":"c3dc8528-77f9-4e5b-b3b4-fd185d323166","resolution":{"observed_at":"2026-08-12T17:15:48.502602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-12T17:15:47.835813Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.835813Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:2bece1e1bfd9948a95efbe8c2198ef6bd266728e6573c8a6f6c3d82bf11a7c5f","observation_id":"b83db4eb-5179-401b-a927-dd8a7d208015","resolution":{"observed_at":"2026-08-12T17:15:47.835813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02054","last_updated":"2024-02-04T10:48:30Z","snapshot_observed_at":"2026-08-13T05:58:26.330217Z","submitted_at":"2023-10-03T13:53:08Z","title":"AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02054","snapshot_observed_at":"2026-08-12T17:15:47.840044Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.840044Z"},"links":{"cited_paper":"/paper/2310.02054","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:9c275adda427b1a68f5d4a0372b72c44dd050b1f1375d31173141c7fd2ca5f01","observation_id":"d77b52b3-ffcf-4168-ada9-63c5d20a9e18","resolution":{"observed_at":"2026-08-12T17:15:47.840044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-12T17:15:47.848222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.848222Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:7d21a8223b46fbc56864ff621287aa23705b9bb6dcfbf6a1b60af6ad628a9e0c","observation_id":"3af6c8b8-c15d-43ce-8191-56798173b0c4","resolution":{"observed_at":"2026-08-12T17:15:47.848222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.852311Z","title":null,"venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.852311Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:03c7d57a473ea69ab5521cb6505420924d1e9b4711c0e8bab8ef59a19283551c","observation_id":"b902db48-cb28-4ae0-84b9-70ae807cc43f","resolution":{"observed_at":"2026-08-12T17:15:47.852311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T17:15:47.856138Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.856138Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:038cf008c309b029e44bbb41d78cfecdb1707679b6e797fd9853f80439ac7a9a","observation_id":"940f65f2-140c-471d-b43c-2e6c68a55b92","resolution":{"observed_at":"2026-08-12T17:15:47.856138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-12T17:15:47.859637Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.859637Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:dd3ccb5241709055b86243dbc55b703e0e821b6da0c769f5b2237d09d63771ac","observation_id":"9a96e8ad-c492-4abe-bda4-17336cf459b9","resolution":{"observed_at":"2026-08-12T17:15:47.859637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.863766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.863766Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:edfa1bf27557e49143e28dc31e575a25462330ee092378cc2e2f826050399da7","observation_id":"2561aac9-bb22-4ecd-b954-2056a00fcb8d","resolution":{"observed_at":"2026-08-12T17:15:47.863766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.488487Z","title":"Smith, Hannaneh Hajishirzi","venue":null,"work_id":"9ade0a62-f84a-4d5b-891e-9f9c48301316","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.867933Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:1d873e554031d90992d9dc947a88607ebb163606b645f3cacd90a5279d7853d2","observation_id":"940af647-dbf0-44da-84ef-cbae7ac48c00","resolution":{"observed_at":"2026-08-12T17:15:48.492158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-12T17:15:47.872874Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.872874Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:2dad8bab3c761fd96fac6ba0b97cf5659b6c300033d97bc486de778eb7e2bbd9","observation_id":"5ff87c1e-2a71-461b-9b7c-9b5836edc896","resolution":{"observed_at":"2026-08-12T17:15:47.872874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05328","last_updated":"2024-10-05T21:02:57Z","snapshot_observed_at":"2026-08-12T22:29:59.312295Z","submitted_at":"2024-10-05T21:02:57Z","title":"Reward Learning From Preference With Ties","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05328","snapshot_observed_at":"2026-08-12T17:15:47.876946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.876946Z"},"links":{"cited_paper":"/paper/2410.05328","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:afa6925b62f69371a5cc18b0128223c29281f063f28c205775701ab172fbf8a4","observation_id":"92c73e22-97ef-45f7-855b-f8d2ae6cf105","resolution":{"observed_at":"2026-08-12T17:15:47.876946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-13T04:28:04.579767Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-12T17:15:47.880969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.880969Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:dd5bfbf50c732a86e3b5cc85158da3b33864f3f51eec89a6f5c3fce011faf85d","observation_id":"0bb642c8-3734-47cb-8b39-7bd02e952bdb","resolution":{"observed_at":"2026-08-12T17:15:47.880969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-13T06:34:36.036815Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-12T17:15:47.885158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.885158Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:842025d2e702878dd625f732f2b32eddb0f364991d72f43fd15a69e523366a3a","observation_id":"c5b7fa9b-491e-42b9-b450-131bf43bd4af","resolution":{"observed_at":"2026-08-12T17:15:47.885158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T17:15:47.889376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.889376Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:5e155c8e44718efcc9a3db857f176494ab1f0dcbf56409324ebf5094c3d10258","observation_id":"87abdf8f-3f4b-4d97-bd42-e8bc9a804c22","resolution":{"observed_at":"2026-08-12T17:15:47.889376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.478129Z","title":null,"venue":null,"work_id":"2cefb758-2b2a-4789-a8fb-24a1a85afcdc","year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.893254Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:4e1233322372f3ddc24e662aaadb25e3a7fae4629d0f428b1bdedae6897a6392","observation_id":"93e065f2-3805-4137-a6b4-2d950aae6d9a","resolution":{"observed_at":"2026-08-12T17:15:48.481699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.898069Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.898069Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:585bc096fd0b072214f2d41303897ba245aa3db8ea4863deab9aed088af08ba2","observation_id":"d7f4663a-1ec0-45f7-b058-b44373011881","resolution":{"observed_at":"2026-08-12T17:15:47.898069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.461467Z","title":null,"venue":null,"work_id":"5e447718-087a-4145-8abe-f2df1e86c3a5","year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.902599Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:c5994d58a76d7772c199d1ca4cad8a5c24ca35c03da35f392f0414e15a456e6f","observation_id":"6c9964f0-f602-4602-9447-f84738a543bf","resolution":{"observed_at":"2026-08-12T17:15:48.464869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:47.905917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.905917Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:67d2f92874cdd541a809233a91b5d3a6a0dae978443d003765360627dad7194c","observation_id":"68a67b04-bd87-4310-8196-92aa9276446d","resolution":{"observed_at":"2026-08-12T17:15:47.905917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.444930Z","title":null,"venue":null,"work_id":"e2b1158f-be42-4375-b796-8a51b0378849","year":1967},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.909873Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:780c9582fbcffa06ae2eb432fea2e8f7c5fe40909574ae0579572a05f0739195","observation_id":"a5988650-d0e3-4e86-b80f-e694e68a69ba","resolution":{"observed_at":"2026-08-12T17:15:48.448474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.434919Z","title":null,"venue":null,"work_id":"fe3f702a-51e9-441a-ab20-d8b34ee2f89c","year":2004},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.913664Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:58160dd9e32d76a86b1c7a04bc4f3babf150faf72e5e0425a448a210b3931614","observation_id":"d3072f0c-8627-4e49-a563-cc20e1536aff","resolution":{"observed_at":"2026-08-12T17:15:48.438091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.424677Z","title":null,"venue":null,"work_id":"7f32bcef-1c58-4dee-bad5-6047e0cb485a","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.917263Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:16e76644dd887536a5966f2582aee1940d5b817270d87c197803628e484d3df8","observation_id":"b0922306-e35a-4b56-a400-cf09f76f5d87","resolution":{"observed_at":"2026-08-12T17:15:48.428510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-12T17:15:47.921096Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.921096Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:39fd32a7602e67b2454c3e8f4fbc3d689b50d3e1af3aceea575159cc50157c1d","observation_id":"3f8bd9b5-5eb3-496b-a319-81820c7e1d00","resolution":{"observed_at":"2026-08-12T17:15:47.921096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-12T17:15:47.925208Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.925208Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:a0069d91da5513dc00aac6035cb47c9ca3e191a42f13e3c6e5c19fc64f45c2ae","observation_id":"250473cb-99de-4577-8adf-89c68256c17d","resolution":{"observed_at":"2026-08-12T17:15:47.925208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18571","last_updated":"2024-03-06T08:07:02Z","snapshot_observed_at":"2026-08-13T04:07:57.691711Z","submitted_at":"2024-02-28T18:58:25Z","title":"Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18571","snapshot_observed_at":"2026-08-12T17:15:47.929415Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.929415Z"},"links":{"cited_paper":"/paper/2402.18571","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:0f272bdfc4bf270aee2ba7343bfae17f0519a59c972d3f7734eb9e006464b554","observation_id":"0c1c3830-a08e-4dee-aea8-068e398d2bfe","resolution":{"observed_at":"2026-08-12T17:15:47.929415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-12T23:39:50.330661Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-12T17:15:47.933909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.933909Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:d38ded98731d4d1d7461b9c3b113b561839e5efc896e9875dcf112bf7cac6447","observation_id":"6586546e-2a46-48dc-8144-e1e528e25074","resolution":{"observed_at":"2026-08-12T17:15:47.933909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-12T23:44:06.669155Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-12T17:15:47.938224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.938224Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:0d3434b0b707610bc5f8703c57882545344b890b054a03cb3d19eabc0f8da024","observation_id":"5e5792f0-9ebf-48ac-bfaf-dcd252318112","resolution":{"observed_at":"2026-08-12T17:15:47.938224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-13T04:41:57.988720Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-12T17:15:47.942379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.942379Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:2038d477512a6f486558830350fdcd626f49d22ae224f7af19fd552c0fc72812","observation_id":"2cb5f4f7-c7cd-4489-a6f2-2162d6cc3936","resolution":{"observed_at":"2026-08-12T17:15:47.942379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.414271Z","title":null,"venue":null,"work_id":"652a7b34-9da6-47ad-8f30-bbf2128004a3","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.946180Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:315eae12f050bef5c1cfbfe3c8782b2fcb8ff7d3fca65f185c5199dba706bcad","observation_id":"74005b54-252c-498a-b0b3-0efe579b79e0","resolution":{"observed_at":"2026-08-12T17:15:48.417739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.402654Z","title":null,"venue":null,"work_id":"6fe20e7e-7406-4929-8efa-ed255d5ce162","year":2020},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.950140Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:8ba1b986d2d5549c91c81516c8c8b63acc8cb610f8975d21512f6c7034f47520","observation_id":"eec568d8-294d-4e6f-ab4a-d7e74b41319c","resolution":{"observed_at":"2026-08-12T17:15:48.406353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:15:48.388390Z","title":null,"venue":null,"work_id":"734289a1-92bc-49ba-afa0-c9a769f5f218","year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.954036Z"},"links":{"citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:b4554d20fa9f1e912bd48dac7ae1be49ee4c1167ef2078b5b5ad33842dba62b0","observation_id":"14559811-d16a-449b-a098-a619feddcf6f","resolution":{"observed_at":"2026-08-12T17:15:48.394128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-13T00:27:36.209319Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-12T17:15:47.958038Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.958038Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:068fc4e313a2758159c79a290e859cce0a7d21c6d70177402e95e720545686d4","observation_id":"ba846ef6-2e07-4e29-a80a-bb825c1e5a78","resolution":{"observed_at":"2026-08-12T17:15:47.958038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-10T10:05:24.083432Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-12T17:15:47.961445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.961445Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:2fa45df9fb18decbb048ba3f624e78fa48bae4865188bbbee7616e8461af32b5","observation_id":"9a74b634-c129-40ca-b1e4-d533e99c7df5","resolution":{"observed_at":"2026-08-12T17:15:47.961445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.00650","last_updated":"2021-02-01T05:53:04Z","snapshot_observed_at":"2026-08-12T06:49:35.861036Z","submitted_at":"2021-02-01T05:53:04Z","title":"Rethinking Soft Labels for Knowledge Distillation: A Bias-Variance Tradeoff Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.00650","snapshot_observed_at":"2026-08-12T17:15:47.965644Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.965644Z"},"links":{"cited_paper":"/paper/2102.00650","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:4a362f51db895461e95ed80500a3bffe232db5f3cb79dc101a43cdad4b5e643e","observation_id":"b4cbc0b9-fd3d-459d-8dee-dc44595f53ad","resolution":{"observed_at":"2026-08-12T17:15:47.965644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-12T17:15:47.969050Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.969050Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:f2da427a32f52fb884815a2f3f31d07fcf08ea1138ac986f58ca739cb01f61e7","observation_id":"9af073f4-65d2-49b9-b1f3-9963811425cb","resolution":{"observed_at":"2026-08-12T17:15:47.969050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T19:56:50.710873Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2411.12843."}