{"as_of":"2026-08-11T16:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85c641b4c9905346d5c5969c51623ab7012e6b26218f4ece388172f6a4511741","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:45:12.452310Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00911/citation-record","integrity":"/paper/2501.00911/integrity","json":"/paper/2501.00911/citation-record.json","paper":"/paper/2501.00911"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.429409Z","title":null,"venue":null,"work_id":"c4b8e96a-f08b-4ca9-8913-31c8ea52e93e","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.164501Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:9374513420fe252a9658941413977bd41e4422fd255605a61117de9fe8597166","observation_id":"ec3479bc-16d1-42ff-a4ff-c498c8b31ee3","resolution":{"observed_at":"2026-08-10T22:45:13.434617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.412300Z","title":"https://claude.ai/ Claude","venue":null,"work_id":"991c944d-226f-45d4-bc7d-8ebab4f4f11b","year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.170691Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:069d0e785327842c4c4f37e5dfcb98c7fa44f97e370b716689248580739c2336","observation_id":"4b844550-bd51-45df-8c11-613835eda028","resolution":{"observed_at":"2026-08-10T22:45:13.417746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07875","last_updated":"2017-12-06T20:01:54Z","snapshot_observed_at":"2026-07-06T05:27:45.080675Z","submitted_at":"2017-01-26T21:10:29Z","title":"Wasserstein GAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07875","snapshot_observed_at":"2026-08-10T22:45:12.176006Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.176006Z"},"links":{"cited_paper":"/paper/1701.07875","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:accbe9dfba3c998128d52afe8586bcc0e9c0b0536bb3cb96fcfedb7849bcfffa","observation_id":"4a3f310d-bb93-4017-8622-985e59cf9656","resolution":{"observed_at":"2026-08-10T22:45:12.176006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.181779Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.181779Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:20113543f5d0938ef2f56dd709f850bc095c32030cb3bf255bb9ca555dd1c6bb","observation_id":"22a944a4-4d6f-4d3f-8f29-81a8644bf16b","resolution":{"observed_at":"2026-08-10T22:45:12.181779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-10T22:45:12.187680Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.187680Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:9f553e8de16ad029ea2ffada6216bac0255c3a72afd8a8bff19597c7fcdca4b1","observation_id":"4a0b8ffb-f07f-4273-8905-0b6072b4c0e3","resolution":{"observed_at":"2026-08-10T22:45:12.187680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.385183Z","title":null,"venue":null,"work_id":"5692aab2-f2b0-452f-b01f-0f4bb9206a5c","year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.198606Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:d7b17dc8ceac4c7dcc4bbe86cb325baccadb77bccfe7d3a57bb17bfd7c6735e5","observation_id":"9fd5e676-b502-475b-96b3-aa5f68fe30fd","resolution":{"observed_at":"2026-08-10T22:45:13.390203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.364494Z","title":null,"venue":null,"work_id":"de02c767-3123-413a-9de3-7549752d6a9e","year":2018},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.204272Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:e0cd22c55147564270e630718cedb56c13d5eb78cfe9c44135241fae35eb5e8d","observation_id":"b63d2dc6-dc34-44d1-b8f6-9dc536e35640","resolution":{"observed_at":"2026-08-10T22:45:13.370858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:45:12.209009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.209009Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:29b0fd1d3076f78a984d1d9f66dc102dd7e8a2fe30ab261e0a81c42491987fdd","observation_id":"f22e4843-f4f6-4675-a54d-bd31bcd59cb4","resolution":{"observed_at":"2026-08-10T22:45:12.209009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.215495Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.215495Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:4eb00cb08604adaf447ae22427ea9f77c870656a997378abeb404e49e6fadbcc","observation_id":"51e8f850-9bfc-4a31-b938-e890656a2175","resolution":{"observed_at":"2026-08-10T22:45:12.215495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.334176Z","title":null,"venue":null,"work_id":"d67f207b-af74-457e-b915-93be47407da9","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.220549Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:d86aba2e7b15a14436e7baac3f61fb66334d384752281471563aacc151036ecb","observation_id":"3beec7c8-733f-454b-8434-ebf1fdfb028b","resolution":{"observed_at":"2026-08-10T22:45:13.339535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.315706Z","title":"Ustinova, Hana Ajakan, Pascal Germain, H","venue":null,"work_id":"9e49fda9-18cd-4a10-b4d7-a15c82be5237","year":2015},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.225250Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:1e30c3121f2367f695a4e3db0a7ffb218a1c5e5b1134764fa6257ee129e2303f","observation_id":"80268a2a-c2ba-4c37-bdda-e06be7ef805e","resolution":{"observed_at":"2026-08-10T22:45:13.321934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-10T22:45:12.230638Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.230638Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:c64d9d050e88eb8a8c352d32fddb819f504e978efe18f77027b8b5d7e0e36e47","observation_id":"0eff83a4-e1f8-4ef7-ba63-5a00b1299d15","resolution":{"observed_at":"2026-08-10T22:45:12.230638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T22:45:12.235972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.235972Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:56779a3d617d6336baacb0184d03fcacc9f23456b99444299d027fb3bf9b27fa","observation_id":"2d8c36a4-6021-4a39-bfe8-28126657e856","resolution":{"observed_at":"2026-08-10T22:45:12.235972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00028","last_updated":"2017-12-25T23:03:49Z","snapshot_observed_at":"2026-08-10T12:15:09.941778Z","submitted_at":"2017-03-31T19:25:00Z","title":"Improved Training of Wasserstein GANs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00028","snapshot_observed_at":"2026-08-10T22:45:12.241129Z","title":"Courville","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.241129Z"},"links":{"cited_paper":"/paper/1704.00028","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:a52b8bf4d1648a11d8b90b23f4852f1bdbfed4602a03ff1f75cc02509d78f6b3","observation_id":"7d03db23-832b-4021-977d-f7bf771db709","resolution":{"observed_at":"2026-08-10T22:45:12.241129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-10T22:45:12.246781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.246781Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:243a83ccaae9f1b755fd580ea9b735eac96ffa8c8246aff7bee6612edd69eb03","observation_id":"525eec75-07ad-4631-9a9f-da21d0e2f561","resolution":{"observed_at":"2026-08-10T22:45:12.246781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06751","last_updated":"2024-06-05T14:10:11Z","snapshot_observed_at":"2026-08-01T14:47:35.061077Z","submitted_at":"2024-01-12T18:36:29Z","title":"The Unreasonable Effectiveness of Easy Training Data for Hard Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06751","snapshot_observed_at":"2026-08-10T22:45:12.252155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.252155Z"},"links":{"cited_paper":"/paper/2401.06751","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:96c8dbafd179f76b1f3482826d726701d3caec8b0701f9ce1bd114ded16664aa","observation_id":"9715775d-83cb-40a2-8121-0d37b211048c","resolution":{"observed_at":"2026-08-10T22:45:12.252155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.297810Z","title":null,"venue":null,"work_id":"019ce858-1e03-4b09-8424-1c671371d937","year":2016},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.257783Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:6765929951a5f0adb402c698d62234e5c656fe2bf86269f2ce6ac678c99d1ce2","observation_id":"0482d9d0-e854-4409-83b1-de60c72f6608","resolution":{"observed_at":"2026-08-10T22:45:13.302982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:45:12.262601Z","title":"Edward Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.262601Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:ffb9b3da84356d78e5e3c7397627cc6b21c19540cd6a4e1ba7b3e9c0d377e8f4","observation_id":"1b571a44-facb-4844-b079-229b3f4fc963","resolution":{"observed_at":"2026-08-10T22:45:12.262601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.280253Z","title":null,"venue":null,"work_id":"59503321-dd1f-4927-b8ee-dda1689e2b2e","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.267497Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:29b9b6b67310b994cea26fa079b0b940e11d33bb9b9cf10b81d433c96e733523","observation_id":"1c2111e6-485b-465c-b7c6-982e37b8167e","resolution":{"observed_at":"2026-08-10T22:45:13.285434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.261728Z","title":null,"venue":null,"work_id":"6e7b3337-c654-4b44-a541-1184e59954b3","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.272533Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:a012f5a6212c36694fb8699179ac84c1d2b0a08937ab9dae43cb70cb738f0c96","observation_id":"f719bc80-b061-4a16-9be3-dd5ca1ac8290","resolution":{"observed_at":"2026-08-10T22:45:13.268035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07078","last_updated":"2021-04-14T19:05:01Z","snapshot_observed_at":"2026-08-11T14:30:50.779704Z","submitted_at":"2021-04-14T19:05:01Z","title":"UDALM: Unsupervised Domain Adaptation through Language Modeling","version":1},"cited_work":{"arxiv_id":"2104.07078","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.07078","snapshot_observed_at":"2026-08-10T22:45:12.891444Z","title":"UDALM: Unsupervised Domain Adaptation through Language Modeling","venue":"cs.CL","work_id":"a9127fcd-1c48-4750-9515-3dd0c8b5fc1a","year":2021},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.277915Z"},"links":{"cited_paper":"/paper/2104.07078","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:f88d30385f4a4ce664ae6c9748a9b6c326318cafa9eb8efdac3b6ffba30ddf31","observation_id":"5aa80a67-2fb3-40b9-af20-44ae63ebf13b","resolution":{"observed_at":"2026-08-10T22:45:12.897397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04412","last_updated":"2025-03-04T00:04:24Z","snapshot_observed_at":"2026-08-09T05:49:56.646876Z","submitted_at":"2024-06-06T18:01:02Z","title":"Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04412","snapshot_observed_at":"2026-08-10T22:45:12.283131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.283131Z"},"links":{"cited_paper":"/paper/2406.04412","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:32519eba0b07d9119cea4195751c9dd05e917311343d3bb52f8534efb0f92b55","observation_id":"f121deb6-27f1-4e45-a3cb-39abe0b41336","resolution":{"observed_at":"2026-08-10T22:45:12.283131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.241354Z","title":null,"venue":null,"work_id":"64c05f9e-218a-4ebd-b8a3-3b2ef4a4ad42","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.288497Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:bc6fdb9ce60e8ec60f5fd584214b2568d77b38047f0536b43f06badf88ee7db5","observation_id":"399c1371-c5ea-41d9-900a-eb1a7ec50e34","resolution":{"observed_at":"2026-08-10T22:45:13.247219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-07-29T18:39:02.141391Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-10T22:45:12.293458Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.293458Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:44f9f3c02593c2a03f392dd90dbce521cbd9d07d656c390514309885e4a2347b","observation_id":"cac133d6-8dd6-4c6a-8397-d1f010ce696d","resolution":{"observed_at":"2026-08-10T22:45:12.293458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-10T22:45:12.299196Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.299196Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:94a63b02fa08e48fb295bfde5d561876f9a8500ab9b809a8701019bd4d27d7f5","observation_id":"f67971a3-3e53-47bb-bb5f-339ef22d38be","resolution":{"observed_at":"2026-08-10T22:45:12.299196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-10T22:45:12.304282Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.304282Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:a1660821a544942217d6464197058426c0f643cb6761903b92ea95b3d690d891","observation_id":"2855cfac-44af-460d-9951-9d95e4373c8c","resolution":{"observed_at":"2026-08-10T22:45:12.304282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.223954Z","title":null,"venue":null,"work_id":"9fe0d89b-0367-48a7-a713-a8b02648c000","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.309736Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:ac84b000e08b62f18eca4b788f3d6d45f52cae55bc360906dc69913b2aa2a8a5","observation_id":"ad49babe-b993-4957-9fee-352854386105","resolution":{"observed_at":"2026-08-10T22:45:13.228994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16235","last_updated":"2024-11-08T02:17:22Z","snapshot_observed_at":"2026-07-06T18:35:45.699877Z","submitted_at":"2024-06-23T22:53:47Z","title":"Preference Tuning For Toxicity Mitigation Generalizes Across Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16235","snapshot_observed_at":"2026-08-10T22:45:12.315612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.315612Z"},"links":{"cited_paper":"/paper/2406.16235","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:4e64a496f924174a9f703a10f7cb2fa5231168bbedc44e196424d95c9d9e97d5","observation_id":"adb34e46-df8e-40f3-9fda-79761d91fc62","resolution":{"observed_at":"2026-08-10T22:45:12.315612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T22:45:12.322212Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.322212Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:05838b07d4b3aa3cc20b54ce008fd6052ab6ac1106564da1e5690c513aeaa6ba","observation_id":"73d1d84f-8ece-4bb0-8598-380f9625dd49","resolution":{"observed_at":"2026-08-10T22:45:12.322212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-10T22:45:12.326988Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.326988Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:9d6e247617eba97394fe77192783404027b013aa20ec80795eb0d43b7e93b0af","observation_id":"df829618-1316-49a3-ba2b-111a0c5aa761","resolution":{"observed_at":"2026-08-10T22:45:12.326988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.194295Z","title":"https://chatgpt.com/ Chatgpt","venue":null,"work_id":"90b73521-9828-4a0a-a1e7-519a09a062f0","year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.332430Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:160a425ce9dece57182d540d7253534f92d299347dd5d4632af92e1afc396906","observation_id":"c9293c1f-65b5-46e0-81f3-3e1e4d1441dd","resolution":{"observed_at":"2026-08-10T22:45:13.211159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T22:45:12.338619Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.338619Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:1eb99ec36a3d23173435d5011951ccb66ad1d9003dff5e867b984701919020fd","observation_id":"aad28e62-e728-4eea-bb76-3be7c1245df8","resolution":{"observed_at":"2026-08-10T22:45:12.338619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-10T22:45:12.344286Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.344286Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:8a7272c3670242d73669def080145b6601d7b94e0c421f49baf81b92ed4bb375","observation_id":"8eb05ed5-6849-4bc4-ad4b-7687b0f1e684","resolution":{"observed_at":"2026-08-10T22:45:12.344286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T22:45:12.349688Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.349688Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:3047298e5781774638a35eff4c32d6e0d8684fd91add49fcbea680888875df5e","observation_id":"b2c82572-4120-4f94-971a-a25ff1d87f10","resolution":{"observed_at":"2026-08-10T22:45:12.349688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00888","last_updated":"2025-04-18T19:45:34Z","snapshot_observed_at":"2026-08-03T23:08:24.202894Z","submitted_at":"2024-06-02T23:13:56Z","title":"Aligning Language Models with Demonstrated Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00888","snapshot_observed_at":"2026-08-10T22:45:12.355146Z","title":"Bernstein, and Diyi Yang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.355146Z"},"links":{"cited_paper":"/paper/2406.00888","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:6b59dbba866f91c43c906104ca537d791fa309663f03c57f308262bac4ca1091","observation_id":"c68407d2-bd69-4615-b5b9-025746aa746f","resolution":{"observed_at":"2026-08-10T22:45:12.355146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01217","last_updated":"2018-03-09T07:20:13Z","snapshot_observed_at":"2026-07-06T05:49:45.626127Z","submitted_at":"2017-07-05T05:34:13Z","title":"Wasserstein Distance Guided Representation Learning for Domain Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01217","snapshot_observed_at":"2026-08-10T22:45:12.361165Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.361165Z"},"links":{"cited_paper":"/paper/1707.01217","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:de9accea466d815ac5ef2014e2e990c641ce7ff5609a3c67144ccd992cdf9ec6","observation_id":"bb8d7799-1e80-43f4-8d2a-29b83943b9e6","resolution":{"observed_at":"2026-08-10T22:45:12.361165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09472","last_updated":"2024-12-10T08:54:09Z","snapshot_observed_at":"2026-08-11T08:15:23.637258Z","submitted_at":"2024-03-14T15:12:38Z","title":"Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09472","snapshot_observed_at":"2026-08-10T22:45:12.367288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.367288Z"},"links":{"cited_paper":"/paper/2403.09472","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:42ec4ea7502529fe7df697313bde614bcc7451041f4485cbdfc8015b48652f67","observation_id":"9d92ae9d-cbe4-41d3-96c7-d9cd1c25a657","resolution":{"observed_at":"2026-08-10T22:45:12.367288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05940","last_updated":"2023-06-24T07:43:35Z","snapshot_observed_at":"2026-08-04T14:32:59.837931Z","submitted_at":"2023-05-10T07:24:36Z","title":"Multilingual LLMs are Better Cross-lingual In-context Learners with Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05940","snapshot_observed_at":"2026-08-10T22:45:12.372847Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.372847Z"},"links":{"cited_paper":"/paper/2305.05940","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:8b3d488fa29cd7c4fdee2a25cfc0f46ab78bbb52b42a50045a87d2cd9bac805b","observation_id":"2de6c780-9bdd-4dee-835c-7e2d8618b558","resolution":{"observed_at":"2026-08-10T22:45:12.372847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06601","last_updated":"2023-03-18T20:44:45Z","snapshot_observed_at":"2026-08-09T01:21:57.508175Z","submitted_at":"2022-04-13T18:41:41Z","title":"Causal Confusion and Reward Misidentification in Preference-Based Reward Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06601","snapshot_observed_at":"2026-08-10T22:45:12.378181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.378181Z"},"links":{"cited_paper":"/paper/2204.06601","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:02640b502460b0fde4cf9e6f1fd23a85b6e8a7680ecfe3f49b03f6dbae709b6d","observation_id":"ef303f7c-fb2a-4fb1-8fde-c11ed3a7cf1d","resolution":{"observed_at":"2026-08-10T22:45:12.378181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.175335Z","title":"Chernova, and Dhruv Batra","venue":null,"work_id":"f4739a96-1319-4fc0-a282-68d54051ab2f","year":2020},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.383414Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:049b0d3853c67a036eb38616ba36a40991a9f7a06481302f53a2d74fe92f9c93","observation_id":"15eaf064-48e0-4a6e-8d5e-c6c2f796e857","resolution":{"observed_at":"2026-08-10T22:45:13.181683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3474","last_updated":"2014-12-10T21:20:54Z","snapshot_observed_at":"2026-07-06T04:03:12.627088Z","submitted_at":"2014-12-10T21:20:54Z","title":"Deep Domain Confusion: Maximizing for Domain Invariance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3474","snapshot_observed_at":"2026-08-10T22:45:12.388655Z","title":"Zhang, Kate Saenko, and Trevor Darrell","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.388655Z"},"links":{"cited_paper":"/paper/1412.3474","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:8f5073bc370dfb8ed799e5c086b78c9265579a017f6c196b9510fc0c0f993fa2","observation_id":"d9e7e8de-fa6f-4e8d-a26d-4cccde6dc901","resolution":{"observed_at":"2026-08-10T22:45:12.388655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.393710Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.393710Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:96605df90c043bc9efcef73a0dcf751a89197c48033a0ab3e467bd3804ea3cf9","observation_id":"9e561a12-24a5-4b02-b30d-94e811486f54","resolution":{"observed_at":"2026-08-10T22:45:12.393710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.155392Z","title":null,"venue":null,"work_id":"cd4aad57-a7a3-405f-9cdb-5e1a50d255f2","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.398638Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:c737d2b6d3f27dcc99c21d6f431913959ac594438ceafa4766b8f13af3f40316","observation_id":"6adc45c0-0464-4e51-a507-fb1f30304374","resolution":{"observed_at":"2026-08-10T22:45:13.161418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.135832Z","title":null,"venue":null,"work_id":"9f18020c-7d9c-4b54-b721-ea9a24b15889","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.404542Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:5e559eeb24ccdd04e3f38b26f90dfc31eab7a9c6a80fae8568145d764f12f5a8","observation_id":"a05d9238-5b9f-42d9-b0e6-ff3ebf2d2d76","resolution":{"observed_at":"2026-08-10T22:45:13.141030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12318","last_updated":"2024-10-14T17:58:05Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T16:52:36Z","title":"Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment","version":2},"cited_work":{"arxiv_id":"2404.12318","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12318","snapshot_observed_at":"2026-08-10T22:45:12.585236Z","title":"Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment","venue":"cs.CL","work_id":"104e3b2f-59d2-44cd-840b-6132babfb1d9","year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.409531Z"},"links":{"cited_paper":"/paper/2404.12318","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:aab75dfae0a5749c5f82cca30449ef0659aec9c31e8a85b45bf82ea0b85b1379","observation_id":"1340b498-31a0-45e7-b283-1ec86018401b","resolution":{"observed_at":"2026-08-10T22:45:12.593278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09705","last_updated":"2023-07-19T01:22:40Z","snapshot_observed_at":"2026-07-06T15:55:41.294452Z","submitted_at":"2023-07-19T01:22:40Z","title":"CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09705","snapshot_observed_at":"2026-08-10T22:45:12.414979Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.414979Z"},"links":{"cited_paper":"/paper/2307.09705","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:736061ef221ebaf0aef672de467b21ab3da0489ac9a556b621f894c28b32a24a","observation_id":"97b509e2-18b3-48b6-9e74-8dfa8fc741ee","resolution":{"observed_at":"2026-08-10T22:45:12.414979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-10T08:43:37.608281Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-10T22:45:12.420151Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.420151Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:a896ff64da568827b5b774cafab0dd0378b1be8cb2bea3d44f9bd4133d700083","observation_id":"99232992-40d2-465d-94e1-27471d260e93","resolution":{"observed_at":"2026-08-10T22:45:12.420151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-10T18:32:18.501904Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-10T22:45:12.425370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.425370Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:cdbdc47ef8aad2bf8bd100a04d58d7e06b8639826ed9e34d07f5268d9db798ca","observation_id":"e724335a-a9ae-42b5-9421-b8240cf682a8","resolution":{"observed_at":"2026-08-10T22:45:12.425370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-10T22:45:12.431407Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.431407Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:c1edda893a9dd2c8b4857ba2f00afb0355236c32d989652ad579b32ed060c354","observation_id":"0496f569-b2bf-4586-9b6e-075691c6365c","resolution":{"observed_at":"2026-08-10T22:45:12.431407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.118834Z","title":null,"venue":null,"work_id":"f8bc1c4f-64a9-4907-97ee-799de720a592","year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.436817Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:ef0761ced91cc878e6a33b4a02f1c55feb45582ac79c35d1b0338d06e1fd9dcc","observation_id":"4a406a80-2238-4f13-bd0a-8ba6f59e3246","resolution":{"observed_at":"2026-08-10T22:45:13.123721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-10T22:45:12.441631Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.441631Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:c4779625ba45cf79d23528b5ece1247630755ac147e2efa8723cc3de647e0379","observation_id":"f39061c4-0a81-46a2-bb04-17b0c58d1b40","resolution":{"observed_at":"2026-08-10T22:45:12.441631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.446752Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.446752Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:2aa1abfa44cba074cdc830a52cdbc9866b4dcb254f7fdec982a265020dd6bff3","observation_id":"b527aeef-d4b6-463d-9df6-3949ecd8a411","resolution":{"observed_at":"2026-08-10T22:45:12.446752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.452310Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.452310Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:9608166be5495824c7928b69e7fbb41330a64965647c41e32e22d6e5e1619458","observation_id":"1adb606a-3623-4c4a-a5c1-dfb6f422aee9","resolution":{"observed_at":"2026-08-10T22:45:12.452310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:37:21.538654Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2501.00911."}