{"as_of":"2026-08-07T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a1346fe4d148bd10e9c59a7688bcc51037cd5d839bbfa211ce02f472500453b","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:49:12.744748Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T21:50:04.277333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T21:53:59.319586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"cited_work":{"arxiv_id":"2507.20181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20181","snapshot_observed_at":"2026-06-29T21:53:59.319586Z","title":"Sgpo: Self-generated preference optimization based on self-improver.arXiv preprint arXiv:2507.20181,","venue":null,"work_id":"6b165359-750e-4a21-9003-dfeb3e16656a","year":null},"citing_paper":{"arxiv_id":"2605.25511","last_updated":"2026-05-25T07:15:38Z","snapshot_observed_at":"2026-08-04T16:23:31.884909Z","submitted_at":"2026-05-25T07:15:38Z","title":"CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T21:50:04.277333Z"},"links":{"cited_paper":"/paper/2507.20181","citing_paper":"/paper/2605.25511"},"observation_digest":"sha256:34c1687394f19b092c54cb3329cbbd2033d71683d822512154c0c9d3fd08eb1e","observation_id":"947f8102-1fe8-49dc-a24c-02e15cf8b9ce","resolution":{"observed_at":"2026-06-29T21:53:59.321244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20181/citation-record","integrity":"/paper/2507.20181/integrity","json":"/paper/2507.20181/citation-record.json","paper":"/paper/2507.20181"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T13:49:08.816250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:08.816250Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:9340bdc97d1fd37d2b4b8d13d740cb65761550bf2bbb15a075a61c213a7a3689","observation_id":"218adf37-83e1-4bc7-acd7-51ad3c4a3261","resolution":{"observed_at":"2026-08-06T13:49:08.816250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:20.174804Z","title":null,"venue":null,"work_id":"90324dc6-cef4-4c87-a184-8ed5f0994943","year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:08.862721Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:ad237f3788e61fd0fa13894572eaf6c913522c3ddf567632c13686379d14d61d","observation_id":"13463011-816c-41f2-8085-e668248d658f","resolution":{"observed_at":"2026-08-06T13:49:20.344768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:19.875094Z","title":null,"venue":null,"work_id":"72fa4754-da75-4360-aef9-26f02b0b228f","year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:08.958949Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:5e4f01240d72e85296c11bb09d4231e64c405e3083d898d8b6444b7088deccaf","observation_id":"aeb2beee-7e3d-4203-9714-8a02d3a3ca38","resolution":{"observed_at":"2026-08-06T13:49:19.995174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:19.593240Z","title":null,"venue":null,"work_id":"9386a165-1fd8-4e18-8d15-f429222d9511","year":1952},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.102411Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:7f2a156c2bc6472c841799a02e9fc2dc432d641ec28bb087fffaff5c4d609b3a","observation_id":"e785ae85-99be-4f40-bdca-365601068144","resolution":{"observed_at":"2026-08-06T13:49:19.678456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-06T13:49:09.238274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.238274Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:fe069a39899fdafbba984c87938bff70cd8726ed61040da3d02d61c9e3d6143e","observation_id":"9f0da655-79b6-4489-a6a3-6805654e7339","resolution":{"observed_at":"2026-08-06T13:49:09.238274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08045","last_updated":"2024-06-03T11:34:05Z","snapshot_observed_at":"2026-08-07T07:16:15.041179Z","submitted_at":"2023-11-14T10:10:31Z","title":"Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08045","snapshot_observed_at":"2026-08-06T13:49:09.346979Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.346979Z"},"links":{"cited_paper":"/paper/2311.08045","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:a40d976977ad0921d8e20f2e52a7355d292551ff0e21cf4a11d0c3ee001c1a15","observation_id":"46f8de97-fbd4-40f0-81b4-0ae2ff21e7fd","resolution":{"observed_at":"2026-08-06T13:49:09.346979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:09.455257Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.455257Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:ff60e05ebfe7d0a7612b831a2b26c8f8a21a63a7dd835877de7ca7dccb8fc4cb","observation_id":"59f6dad7-8db8-4129-9168-c3d4c7a1e89d","resolution":{"observed_at":"2026-08-06T13:49:09.455257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-06T13:49:09.586836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.586836Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:8a6b52fc525a7d0701630835c2a23e8c7514553f6f74751714f395e94d9a2c91","observation_id":"c76ba237-8933-46c0-a95c-58f59d25c818","resolution":{"observed_at":"2026-08-06T13:49:09.586836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-06T13:49:09.717188Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.717188Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:365749b2670416026b52500315dda29528d97de1d0e1450701efcb3097eac3fe","observation_id":"70bec32c-9c8e-41a5-b0f2-07fba5c59326","resolution":{"observed_at":"2026-08-06T13:49:09.717188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06961","last_updated":"2024-10-09T14:57:31Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:57:31Z","title":"Self-Boosting Large Language Models with Synthetic Preference Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06961","snapshot_observed_at":"2026-08-06T13:49:09.839915Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.839915Z"},"links":{"cited_paper":"/paper/2410.06961","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:84fac0b1eb5ca3596fd86ce136f09427bc2196f6650411a94abf1cefea24e943","observation_id":"0033f159-6de3-49f9-9d73-1523e9f65203","resolution":{"observed_at":"2026-08-06T13:49:09.839915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-06T13:49:09.973104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:09.973104Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:1f72dc21c8050dce3f2b6c20cc6fc5f6829c468ef3b6643ee988b94c10e73ffa","observation_id":"cb8e265d-19c1-4951-bd23-0aca5b6063a2","resolution":{"observed_at":"2026-08-06T13:49:09.973104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T13:49:10.135814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:10.135814Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:f685c14f6454145e7488203e1c05b39775fe1df101d73dc46391517fd2c020b7","observation_id":"d64bc04f-19bd-4ace-a173-0459641aa652","resolution":{"observed_at":"2026-08-06T13:49:10.135814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-06T13:49:10.325731Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:10.325731Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:3262bc60a6d2c6df58afc31b4d17331d6a5fc4c0027d5803b2281fdc7f24ac83","observation_id":"16cb55b0-d657-497b-acca-4ebb4b0a65dd","resolution":{"observed_at":"2026-08-06T13:49:10.325731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:19.164748Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"cd6dded3-5b72-46be-aa78-3e176f3c81ad","year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:10.495510Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:4e28ef702bce2ac412220a288f5cc20b98559c5b1c350581922af764a4e0008b","observation_id":"607acf99-2098-4313-afd7-fa867c41114b","resolution":{"observed_at":"2026-08-06T13:49:19.314290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11253","last_updated":"2024-06-25T13:39:52Z","snapshot_observed_at":"2026-08-01T08:51:52.481299Z","submitted_at":"2024-02-17T11:25:26Z","title":"Aligning Large Language Models by On-Policy Self-Judgment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11253","snapshot_observed_at":"2026-08-06T13:49:10.586165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:10.586165Z"},"links":{"cited_paper":"/paper/2402.11253","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:4a44fd9be591ba403517eeb639ca4974b34735bd80d0498fd23fabe50e145cac","observation_id":"04bc2687-96b5-459b-a555-c5c035903da7","resolution":{"observed_at":"2026-08-06T13:49:10.586165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-06T13:49:10.711059Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:10.711059Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:7e21ad9b9e0d153a3a47cf38f2063fa81e0788e181b839f6e7bbf3898b4a3451","observation_id":"0e14469a-1170-4fc2-86d6-ee4e03131e48","resolution":{"observed_at":"2026-08-06T13:49:10.711059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:10.855926Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:10.855926Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:f018a982d10b3f889be2abdda6b603cb7cd48644c7193169271ba85a4ddc2303","observation_id":"ce305cc2-aff6-4b1f-9e14-1b93677f14e7","resolution":{"observed_at":"2026-08-06T13:49:10.855926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10584","last_updated":"2024-02-25T19:15:26Z","snapshot_observed_at":"2026-07-06T17:04:09.326801Z","submitted_at":"2023-12-17T02:14:15Z","title":"Policy Optimization in RLHF: The Impact of Out-of-preference Data","version":2},"cited_work":{"arxiv_id":"2312.10584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.10584","snapshot_observed_at":"2026-08-06T13:49:14.654740Z","title":"Policy Optimization in RLHF: The Impact of Out-of-preference Data","venue":"cs.LG","work_id":"a61fb487-8a71-4c69-8aa3-3e2b8ba799fb","year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:10.944764Z"},"links":{"cited_paper":"/paper/2312.10584","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:37cb4bace1f9cb0f9b2cb2800088277653fb875bc6106026b0a44d6577378315","observation_id":"6c8d9209-bf45-4f0c-b311-fe1ce12383eb","resolution":{"observed_at":"2026-08-06T13:49:14.825066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03650","last_updated":"2024-10-03T17:13:04Z","snapshot_observed_at":"2026-08-03T13:15:41.992380Z","submitted_at":"2024-09-05T16:08:19Z","title":"On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":"2409.03650","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03650","snapshot_observed_at":"2026-08-06T13:49:14.274811Z","title":"On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization","venue":"cs.LG","work_id":"625bc30a-47a0-4de3-9235-590d9e9c3f44","year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.026985Z"},"links":{"cited_paper":"/paper/2409.03650","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:f9061d4f47903a9e6aa0071d636908ab5d27e465ae0aa0fcb04be39af7e5e92a","observation_id":"fe9e3cb7-3729-47c1-9aab-1d4e935edfe0","resolution":{"observed_at":"2026-08-06T13:49:14.414833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:18.794746Z","title":null,"venue":null,"work_id":"f7cd0607-3390-4330-9662-5c0f190c154f","year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.128476Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:a27f0e0b1888ea9b4a924c529bb394af2d341041592c1791a7263208e0a210b9","observation_id":"38c2ae32-11c9-4c86-802d-f0e51bcc0488","resolution":{"observed_at":"2026-08-06T13:49:18.925877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:11.247879Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.247879Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:58aca53b570bd264c8a0e548d157dd68e4388d2c058f6c010fbcbd6398e14b50","observation_id":"d7f34326-7bca-4651-86e2-b7239bb3a572","resolution":{"observed_at":"2026-08-06T13:49:11.247879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:11.418784Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.418784Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:da060c60f57b029e75772ffe6f5b14a78d6b7a2a8c42af6a762e8ce4df4a41e7","observation_id":"633efd08-fb34-4ddd-bd99-ee6777d6057a","resolution":{"observed_at":"2026-08-06T13:49:11.418784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:11.525562Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.525562Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:9f3c0bae90fa2d971c22fc5fb2fe1891367fa8fbbcc01275d1fc4e93ebc15306","observation_id":"1770901a-6ce4-44c9-b19c-22c9f6c2bdf8","resolution":{"observed_at":"2026-08-06T13:49:11.525562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T13:49:11.648680Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.648680Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:5a1a55bef2ca4d1cea0b61702d14862c6d385b8ba95d55e2fe1dca50808e9988","observation_id":"818b0297-07b8-4499-a552-fbc38e544d52","resolution":{"observed_at":"2026-08-06T13:49:11.648680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T13:49:11.753618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.753618Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:b303697eabe605c9cca14cd1783ccd4effbbb1b4570ef4f34e65669f2de5b22c","observation_id":"75c79851-0414-4105-8cd6-3f81f4868f97","resolution":{"observed_at":"2026-08-06T13:49:11.753618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:18.085900Z","title":"Gonzalez Ion Stoica Tianle Li*, Wei-Lin Chiang*","venue":null,"work_id":"58e6734d-abf4-44b1-a707-ea496d301123","year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:11.877653Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:e18a727ea90901bc02d7c76dc49ede10e0ae1c4e9baebcefd5f012fbc977fa43","observation_id":"40063e0f-ab9b-4442-8869-a67a024e071c","resolution":{"observed_at":"2026-08-06T13:49:18.390884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:17.574830Z","title":null,"venue":null,"work_id":"76b9ce3b-254e-44d6-8e8d-aed464696f57","year":1977},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:12.044340Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:e478404dd455052e89097020d5896e4bb9096fa35985e7cf8f63166afe3c70ae","observation_id":"0415b894-80c1-4d16-95d3-2098b378e352","resolution":{"observed_at":"2026-08-06T13:49:17.786355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:16.934752Z","title":null,"venue":null,"work_id":"5897e07f-2051-420e-b17a-85a8b602a81a","year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:12.199822Z"},"links":{"citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:e81e3267ab9d9ea89be2a2d126f9caae819fb52f5df95f1f25da2569b8123bb0","observation_id":"0918c373-5883-4698-8650-fde440eb5855","resolution":{"observed_at":"2026-08-06T13:49:17.044754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-07-06T18:53:00.965448Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-06T13:49:12.374832Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:12.374832Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:485ee3a3f08491c7e12a92cf411b20b6a984eeb45a622bbcdb620d85177ed30c","observation_id":"5cf96810-b462-4a32-874d-ae31e45beba5","resolution":{"observed_at":"2026-08-06T13:49:12.374832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T13:49:12.592647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:12.592647Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:354e98c3b4844d79c4dd79ef9c4169d074ee9e24ea37d3e282792c212869fd3c","observation_id":"b382979c-aa17-47b9-801d-7ea4d6055928","resolution":{"observed_at":"2026-08-06T13:49:12.592647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16574","last_updated":"2024-12-08T14:22:13Z","snapshot_observed_at":"2026-07-06T18:50:43.893885Z","submitted_at":"2024-07-23T15:27:37Z","title":"TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16574","snapshot_observed_at":"2026-08-06T13:49:12.744748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:49:12.744748Z"},"links":{"cited_paper":"/paper/2407.16574","citing_paper":"/paper/2507.20181"},"observation_digest":"sha256:87b40b07ddac636c870f19e6405b0f8b40d3076b930fe1560bbfca3ea0333bfc","observation_id":"b795ecb2-01f1-4d2c-9ace-c13414b4b50b","resolution":{"observed_at":"2026-08-06T13:49:12.744748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20181","last_updated":"2025-07-27T08:55:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T13:49:07.681314Z","submitted_at":"2025-07-27T08:55:40Z","title":"SGPO: Self-Generated Preference Optimization based on Self-Improver"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2507.20181."}