Pith. sign in

Paper Citation Record · LEDGER

SGPO: Self-Generated Preference Optimization based on Self-Improver

As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2507.20181.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.20181 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T13:49:12.744748Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-29T21:50:04.277333Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-29T21:53:59.319586Z

Reference resolution

31 of 31 outbound references displayed

  • verified exact2
  • verified fuzzy2
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 218adf37-83e1-4bc7-acd7-51ad3c4a3261 · outbound

This paper cites GPT-4 Technical Report.

SGPO: Self-Generated Preference Optimization based on Self-Improver GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:08.816250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:08.816250Z digest=sha256:9340bdc97d1fd37d2b4b8d13d740cb65761550bf2bbb15a075a61c213a7a3689

Observation 13463011-816c-41f2-8085-e668248d658f · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:49:20.344768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:08.862721Z digest=sha256:ad237f3788e61fd0fa13894572eaf6c913522c3ddf567632c13686379d14d61d

Observation aeb2beee-7e3d-4203-9714-8a02d3a3ca38 · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:49:19.995174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:08.958949Z digest=sha256:5e4f01240d72e85296c11bb09d4231e64c405e3083d898d8b6444b7088deccaf

Observation e785ae85-99be-4f40-bdca-365601068144 · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:49:19.678456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:09.102411Z digest=sha256:7f2a156c2bc6472c841799a02e9fc2dc432d641ec28bb087fffaff5c4d609b3a

Observation 9f0da655-79b6-4489-a6a3-6805654e7339 · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

SGPO: Self-Generated Preference Optimization based on Self-Improver Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:09.238274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:09.238274Z digest=sha256:fe069a39899fdafbba984c87938bff70cd8726ed61040da3d02d61c9e3d6143e

Observation 46f8de97-fbd4-40f0-81b4-0ae2ff21e7fd · outbound

This paper cites Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game.

SGPO: Self-Generated Preference Optimization based on Self-Improver Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:09.346979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:09.346979Z digest=sha256:a40d976977ad0921d8e20f2e52a7355d292551ff0e21cf4a11d0c3ee001c1a15

Observation 59f6dad7-8db8-4129-9168-c3d4c7a1e89d · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:09.455257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:09.455257Z digest=sha256:ff60e05ebfe7d0a7612b831a2b26c8f8a21a63a7dd835877de7ca7dccb8fc4cb

Observation c76ba237-8933-46c0-a95c-58f59d25c818 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

SGPO: Self-Generated Preference Optimization based on Self-Improver UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:09.586836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:09.586836Z digest=sha256:8a6b52fc525a7d0701630835c2a23e8c7514553f6f74751714f395e94d9a2c91

Observation 70bec32c-9c8e-41a5-b0f2-07fba5c59326 · outbound

This paper cites Enhancing Chat Language Models by Scaling High-quality Instructional Conversations.

SGPO: Self-Generated Preference Optimization based on Self-Improver Enhancing Chat Language Models by Scaling High-quality Instructional Conversations

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:09.717188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:09.717188Z digest=sha256:365749b2670416026b52500315dda29528d97de1d0e1450701efcb3097eac3fe

Observation 0033f159-6de3-49f9-9d73-1523e9f65203 · outbound

This paper cites Self-Boosting Large Language Models with Synthetic Preference Data.

SGPO: Self-Generated Preference Optimization based on Self-Improver Self-Boosting Large Language Models with Synthetic Preference Data

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:09.839915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:09.839915Z digest=sha256:84fac0b1eb5ca3596fd86ce136f09427bc2196f6650411a94abf1cefea24e943

Observation cb8e265d-19c1-4951-bd23-0aca5b6063a2 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

SGPO: Self-Generated Preference Optimization based on Self-Improver KTO: Model Alignment as Prospect Theoretic Optimization

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:09.973104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:09.973104Z digest=sha256:1f72dc21c8050dce3f2b6c20cc6fc5f6829c468ef3b6643ee988b94c10e73ffa

Observation d64bc04f-19bd-4ace-a173-0459641aa652 · outbound

This paper cites The Llama 3 Herd of Models.

SGPO: Self-Generated Preference Optimization based on Self-Improver The Llama 3 Herd of Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:10.135814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:10.135814Z digest=sha256:f685c14f6454145e7488203e1c05b39775fe1df101d73dc46391517fd2c020b7

Observation 16cb55b0-d657-497b-acca-4ebb4b0a65dd · outbound

This paper cites ORPO: Monolithic Preference Optimization without Reference Model.

SGPO: Self-Generated Preference Optimization based on Self-Improver ORPO: Monolithic Preference Optimization without Reference Model

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:10.325731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:10.325731Z digest=sha256:3262bc60a6d2c6df58afc31b4d17331d6a5fc4c0027d5803b2281fdc7f24ac83

Observation 607acf99-2098-4313-afd7-fa867c41114b · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

SGPO: Self-Generated Preference Optimization based on Self-Improver Gonzalez, Hao Zhang, and Ion Stoica

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:49:19.314290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:10.495510Z digest=sha256:4e28ef702bce2ac412220a288f5cc20b98559c5b1c350581922af764a4e0008b

Observation 04bc2687-96b5-459b-a555-c5c035903da7 · outbound

This paper cites Aligning Large Language Models by On-Policy Self-Judgment.

SGPO: Self-Generated Preference Optimization based on Self-Improver Aligning Large Language Models by On-Policy Self-Judgment

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:10.586165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:10.586165Z digest=sha256:4a44fd9be591ba403517eeb639ca4974b34735bd80d0498fd23fabe50e145cac

Observation 0e14469a-1170-4fc2-86d6-ee4e03131e48 · outbound

This paper cites From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.

SGPO: Self-Generated Preference Optimization based on Self-Improver From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:10.711059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:10.711059Z digest=sha256:7e21ad9b9e0d153a3a47cf38f2063fa81e0788e181b839f6e7bbf3898b4a3451

Observation ce305cc2-aff6-4b1f-9e14-1b93677f14e7 · outbound

This paper cites Hashimoto.

SGPO: Self-Generated Preference Optimization based on Self-Improver Hashimoto

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:10.855926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:10.855926Z digest=sha256:f018a982d10b3f889be2abdda6b603cb7cd48644c7193169271ba85a4ddc2303

Observation 6c8d9209-bf45-4f0c-b311-fe1ce12383eb · outbound

This paper cites Policy Optimization in RLHF: The Impact of Out-of-preference Data.

SGPO: Self-Generated Preference Optimization based on Self-Improver Policy Optimization in RLHF: The Impact of Out-of-preference Data

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-08-06T13:49:14.825066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:10.944764Z digest=sha256:37cb4bace1f9cb0f9b2cb2800088277653fb875bc6106026b0a44d6577378315

Observation fe9e3cb7-3729-47c1-9aab-1d4e935edfe0 · outbound

This paper cites On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization.

SGPO: Self-Generated Preference Optimization based on Self-Improver On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-08-06T13:49:14.414833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:11.026985Z digest=sha256:f9061d4f47903a9e6aa0071d636908ab5d27e465ae0aa0fcb04be39af7e5e92a

Observation 38c2ae32-11c9-4c86-802d-f0e51bcc0488 · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:49:18.925877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:11.128476Z digest=sha256:a27f0e0b1888ea9b4a924c529bb394af2d341041592c1791a7263208e0a210b9

Observation d7f34326-7bca-4651-86e2-b7239bb3a572 · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:11.247879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:11.247879Z digest=sha256:58aca53b570bd264c8a0e548d157dd68e4388d2c058f6c010fbcbd6398e14b50

Observation 633efd08-fb34-4ddd-bd99-ee6777d6057a · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:11.418784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:11.418784Z digest=sha256:da060c60f57b029e75772ffe6f5b14a78d6b7a2a8c42af6a762e8ce4df4a41e7

Observation 1770901a-6ce4-44c9-b19c-22c9f6c2bdf8 · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:11.525562Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:11.525562Z digest=sha256:9f3c0bae90fa2d971c22fc5fb2fe1891367fa8fbbcc01275d1fc4e93ebc15306

Observation 818b0297-07b8-4499-a552-fbc38e544d52 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

SGPO: Self-Generated Preference Optimization based on Self-Improver Gemini: A Family of Highly Capable Multimodal Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:11.648680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:11.648680Z digest=sha256:5a1a55bef2ca4d1cea0b61702d14862c6d385b8ba95d55e2fe1dca50808e9988

Observation 75c79851-0414-4105-8cd6-3f81f4868f97 · outbound

This paper cites Qwen2.5 Technical Report.

SGPO: Self-Generated Preference Optimization based on Self-Improver Qwen2.5 Technical Report

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:11.753618Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:11.753618Z digest=sha256:b303697eabe605c9cca14cd1783ccd4effbbb1b4570ef4f34e65669f2de5b22c

Observation 40063e0f-ab9b-4442-8869-a67a024e071c · outbound

This paper cites Gonzalez Ion Stoica Tianle Li*, Wei-Lin Chiang*.

SGPO: Self-Generated Preference Optimization based on Self-Improver Gonzalez Ion Stoica Tianle Li*, Wei-Lin Chiang*

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:49:18.390884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:11.877653Z digest=sha256:e18a727ea90901bc02d7c76dc49ede10e0ae1c4e9baebcefd5f012fbc977fa43

Observation 0415b894-80c1-4d16-95d3-2098b378e352 · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:49:17.786355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:12.044340Z digest=sha256:e478404dd455052e89097020d5896e4bb9096fa35985e7cf8f63166afe3c70ae

Observation 0918c373-5883-4698-8650-fde440eb5855 · outbound

This paper cites an unresolved cited work.

SGPO: Self-Generated Preference Optimization based on Self-Improver Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:49:17.044754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:49:12.199822Z digest=sha256:e81e3267ab9d9ea89be2a2d126f9caae819fb52f5df95f1f25da2569b8123bb0

Observation 5cf96810-b462-4a32-874d-ae31e45beba5 · outbound

This paper cites Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.

SGPO: Self-Generated Preference Optimization based on Self-Improver Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:12.374832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:12.374832Z digest=sha256:485ee3a3f08491c7e12a92cf411b20b6a984eeb45a622bbcdb620d85177ed30c

Observation b382979c-aa17-47b9-801d-7ea4d6055928 · outbound

This paper cites Qwen2 Technical Report.

SGPO: Self-Generated Preference Optimization based on Self-Improver Qwen2 Technical Report

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:12.592647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:12.592647Z digest=sha256:354e98c3b4844d79c4dd79ef9c4169d074ee9e24ea37d3e282792c212869fd3c

Observation b795ecb2-01f1-4d2c-9ace-c13414b4b50b · outbound

This paper cites TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback.

SGPO: Self-Generated Preference Optimization based on Self-Improver TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T13:49:12.744748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:49:12.744748Z digest=sha256:87b40b07ddac636c870f19e6405b0f8b40d3076b930fe1560bbfca3ea0333bfc

Pith citing papers

Observation 947f8102-1fe8-49dc-a24c-02e15cf8b9ce · inbound

CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents cites this paper.

CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents SGPO: Self-Generated Preference Optimization based on Self-Improver

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-06-29T21:53:59.321244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-29T21:50:04.277333Z digest=sha256:34c1687394f19b092c54cb3329cbbd2033d71683d822512154c0c9d3fd08eb1e