{"as_of":"2026-08-14T07:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fdbf69e1e744fbf4d1bcfde05cf25d3ef8830cb1d274fd04c496586de082d68","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:59:12.228176Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09568/citation-record","integrity":"/paper/2608.09568/integrity","json":"/paper/2608.09568/citation-record.json","paper":"/paper/2608.09568"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:13.094128Z","title":"The Softplus activation ensures non-negative output","venue":null,"work_id":"73f67632-12bd-4c8a-b584-a4017bfdf62d","year":2025},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.228176Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:3763a64c4370d135b9d4089060812a1efb08014074c7720dda3567c094cdb062","observation_id":"c6fa8945-4983-4e15-b8ee-fb64a46a421f","resolution":{"observed_at":"2026-08-11T14:59:13.099952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00025","last_updated":"2026-06-10T22:16:48Z","snapshot_observed_at":"2026-08-14T05:00:27.466144Z","submitted_at":"2026-02-03T23:48:13Z","title":"TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00025","snapshot_observed_at":"2026-08-11T14:59:12.089794Z","title":"Tab-po: Preference optimization with a token-level adaptive barrier for token-critical structured generation.arXiv preprint arXiv:2603.00025,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.089794Z"},"links":{"cited_paper":"/paper/2603.00025","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:7df716df987742f06c45e82046a7508634f2a05e75b3cb550bff46c6566763c6","observation_id":"8a8df1ca-40a5-474e-8c68-72426770d7b4","resolution":{"observed_at":"2026-08-11T14:59:12.089794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T14:59:12.102438Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.102438Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:344795bdd8055a3f9cf142fd336a713aad083889e37a1c7ed0cf728feafc4d9a","observation_id":"33b45022-8242-4122-9b16-6b43985a1c3a","resolution":{"observed_at":"2026-08-11T14:59:12.102438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:12.108854Z","title":"Adaptive batch-wise sample scheduling for direct preference optimization.arXiv preprint arXiv:2506.17252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.108854Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:5ee3f0ff77386d7ecccc9e0655d9ca5558efa64e08d75a1cbe1f5f42d5048236","observation_id":"70d24357-23bb-4e09-8381-07e1d75c7ae3","resolution":{"observed_at":"2026-08-11T14:59:12.108854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13177","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:12.774306Z","title":"Kl penalty control via perturbation for direct preference optimization.arXiv preprint arXiv:2502.13177,","venue":null,"work_id":"98127cc9-4cea-4ef4-b366-3cd4bbe1b7e8","year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.120007Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:43fbb0dfebb191f021480a0e0039e08135ca1ec0e333c458841ddb7fbc267bad","observation_id":"13b60a3a-61fa-46b4-872d-bc34ccacddfb","resolution":{"observed_at":"2026-08-11T14:59:12.785116Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.27845","last_updated":"2026-07-30T08:24:58Z","snapshot_observed_at":"2026-08-10T02:17:03.822135Z","submitted_at":"2026-07-30T08:24:58Z","title":"AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification","version":1},"cited_work":{"arxiv_id":"2607.27845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.27845","snapshot_observed_at":"2026-08-11T14:59:12.684637Z","title":"AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification","venue":"cs.CL","work_id":"e1c9e8da-29a9-4518-9687-a1f4326f5d16","year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.125194Z"},"links":{"cited_paper":"/paper/2607.27845","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:333424cfe8be0aac5c3bd1328e1ee3a4782b1fb8df433da203c72f8866831c2a","observation_id":"9b1089d8-0b76-4953-8b22-cc2c7b53c939","resolution":{"observed_at":"2026-08-11T14:59:12.690701Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-11T14:59:12.131103Z","title":"From crowdsourced data to high-quality benchmarks: Arena- hard and benchbuilder pipeline.arXiv preprint arXiv:2406.11939,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.131103Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:8f5b676bc6de296a40638d7fd795c6e6a0c5d7195effc431d13e37d51c3126d6","observation_id":"121b761d-a040-4c1f-8fb9-9f2acc0b40d4","resolution":{"observed_at":"2026-08-11T14:59:12.131103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04350","last_updated":"2025-04-15T03:59:54Z","snapshot_observed_at":"2026-08-12T22:29:55.270911Z","submitted_at":"2024-10-06T04:03:00Z","title":"TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04350","snapshot_observed_at":"2026-08-11T14:59:12.137307Z","title":"Tis-dpo: Token-level importance sampling for direct preference optimization with estimated weights.arXiv preprint arXiv:2410.04350,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.137307Z"},"links":{"cited_paper":"/paper/2410.04350","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:a81a23451a491c22fb331b07f40bb138c713b203e2efea2d82c56e4c96daaf64","observation_id":"49016e83-99d3-461e-9614-038d2905fce0","resolution":{"observed_at":"2026-08-11T14:59:12.137307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.09533","last_updated":"2026-06-10T06:12:57Z","snapshot_observed_at":"2026-08-03T03:00:05.434295Z","submitted_at":"2026-02-10T08:45:30Z","title":"Autoregressive Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":"2602.09533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.09533","snapshot_observed_at":"2026-08-11T14:59:12.610365Z","title":"Autoregressive Direct Preference Optimization","venue":"cs.AI","work_id":"3c15a846-9bb6-4989-9c98-5b300fe67195","year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.142774Z"},"links":{"cited_paper":"/paper/2602.09533","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:437125302ac01f6aeb68523967e68fb6d3d0388cb6bc2ee3c3b0d2aa8192e28f","observation_id":"fa33753e-55f5-45cd-9414-fc31134649ba","resolution":{"observed_at":"2026-08-11T14:59:12.616020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:12.148038Z","title":"Small-margin preferences still matter—if you train them right.arXiv preprint arXiv:2602.00954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.148038Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:c8c4d2c196549f5643bbeb038e30f004d531e53007fc379f87c624c146f08520","observation_id":"56850233-3fec-4c8e-8ff8-4b7147d966d8","resolution":{"observed_at":"2026-08-11T14:59:12.148038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-08-13T00:27:12.618680Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-11T14:59:12.152668Z","title":"From r to q∗: Your language model is secretly a q-function.arXiv preprint arXiv:2404.12358,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.152668Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:3e53012608622240fe8f3f4ed893d8751f5200eee63db7f1e5ba5c2fda52d2e6","observation_id":"45ea035a-bcc7-47b1-a214-9cf9a7f8fc28","resolution":{"observed_at":"2026-08-11T14:59:12.152668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T14:59:12.157429Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.157429Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:b219d7e6a1a1ee3386b0021c75c54ccdf48d88dcc13a08ba8c1e0dfcc5ef0cd7","observation_id":"a99d5f1a-a66f-4978-839a-6f23484af853","resolution":{"observed_at":"2026-08-11T14:59:12.157429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:13.187826Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":"6e3b5339-6b14-4518-be84-8f6435e01e8c","year":2024},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.166894Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:82dca54dbbe733d2cdea22b4fd0d2cbe4a51e6e4e1dd7d73eef30429dfb5e2de","observation_id":"71bbb7a6-f4c8-4a2c-bf4c-ed864b7bcea5","resolution":{"observed_at":"2026-08-11T14:59:13.194401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:13.167735Z","title":"Explore the reasoning capability of LLMs in the chess testbed","venue":null,"work_id":"36614704-ac28-4308-8d55-f8921513b203","year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.172751Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:602784c233191c3ec29167c874d7695cc5dfcdb549ae89729dfefa6af8d38ece","observation_id":"63b16c52-ce48-4e97-8a1e-7bbafd9a170b","resolution":{"observed_at":"2026-08-11T14:59:13.173052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:13.148218Z","title":"URLhttps://aclanthology.org/2025.naacl-short.52/","venue":null,"work_id":"d0e0bc47-6a07-46b2-b660-d7f0d54913ae","year":2025},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.180368Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:1ad0cd7e798d3db1889521185be41530520672f69ca988014830986f2e9b236b","observation_id":"065bbcbc-0ea8-4de3-9c63-5b860f4f90ab","resolution":{"observed_at":"2026-08-11T14:59:13.154557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:12.186010Z","title":"Se- lective preference optimization via token-level reward function estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.186010Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:4c2751c593de004bc03cdf33d6afddeee00ab69216ce5a17a76eae7ed3462d6c","observation_id":"a0d28849-a59f-498a-bcf0-7315c6904fc0","resolution":{"observed_at":"2026-08-11T14:59:12.186010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09816","last_updated":"2026-07-21T10:33:53Z","snapshot_observed_at":"2026-08-10T13:07:01.969938Z","submitted_at":"2026-07-10T06:37:12Z","title":"RUBRIC: Realism--Utility Balanced Ranking for Imbalanced Classification","version":2},"cited_work":{"arxiv_id":"2607.09816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.09816","snapshot_observed_at":"2026-08-11T14:59:12.351463Z","title":"RUBRIC: Realism--Utility Balanced Ranking for Imbalanced Classification","venue":"cs.LG","work_id":"8aeb7645-3c8b-4e45-9959-b4f0cd4a3a3e","year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.192104Z"},"links":{"cited_paper":"/paper/2607.09816","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:b189060db4b62b31286e86fb615749d7c8f09687fba9a4f9c85410e479e7acd8","observation_id":"c911f9fa-1abc-46b8-9a46-443e0f913cc4","resolution":{"observed_at":"2026-08-11T14:59:12.357820Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.04872","last_updated":"2026-08-06T17:56:27Z","snapshot_observed_at":"2026-08-13T20:16:20.577746Z","submitted_at":"2026-08-05T14:01:10Z","title":"A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination","version":2},"cited_work":{"arxiv_id":"2608.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.04872","snapshot_observed_at":"2026-08-11T14:59:12.321899Z","title":"A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination","venue":"cs.CL","work_id":"024dec60-14e0-437b-810e-605a1c87839d","year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.197591Z"},"links":{"cited_paper":"/paper/2608.04872","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:f7afd27e2592d8bb1b2dbed7e1229d1ca3c9344a953800a9bf040c9cc4512850","observation_id":"90cbbf2e-91f9-40bf-9088-e69e9fdbd730","resolution":{"observed_at":"2026-08-11T14:59:12.329770Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:13.131294Z","title":"Wpo: Enhancing rlhf with weighted preference optimization","venue":null,"work_id":"16ee484e-8bd0-441a-a3ee-5a1790ccff19","year":2024},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.202844Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:0cd58961ec9598864c13acd3248c975fa4de04a6ce345cc306563250c2497071","observation_id":"3ae436d4-1233-42b5-b5d3-5b999e4641c1","resolution":{"observed_at":"2026-08-11T14:59:13.136581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-11T11:14:37.903453Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14574","snapshot_observed_at":"2026-08-11T14:59:12.210012Z","title":"Tgdpo: Harnessing token-level reward guidance for enhancing direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.210012Z"},"links":{"cited_paper":"/paper/2506.14574","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:80a4204e25cc8bfe817e36177468c247bed85e75424dc6a738892f503ea786a0","observation_id":"053fcd64-447e-461e-b378-fd25c27137ca","resolution":{"observed_at":"2026-08-11T14:59:12.210012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-11T14:59:12.216222Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.216222Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:913aa7efb68bdb9dda1f8e0adea4267dc4f2803349c19b9138ee07cfa9aabfdf","observation_id":"d324eaf6-ebbf-4695-8e22-4b4855768640","resolution":{"observed_at":"2026-08-11T14:59:12.216222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:12.076346Z","title":"Sparsepo: Controlling preference alignment of llms via sparse token masks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.076346Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:344840184f8c3d18cefb82c17972ad11b4f6ecbe14bb3e4ca3bfb12be31bc32f","observation_id":"fee99bea-86ff-4e65-b828-eb08c74dd85a","resolution":{"observed_at":"2026-08-11T14:59:12.076346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:13.112155Z","title":"Under independent noise, Var[ˆ∆] =∑t c2 t σ2 t","venue":null,"work_id":"6e4f74df-4f00-4b6f-96c4-fb5bf7a0b80c","year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.222521Z"},"links":{"citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:87ee7f0cbd41108e832c82845e3f19f7eaa63a37f1abd613d47b2fa7ca674481","observation_id":"4a452e08-4ea5-4a91-80dc-99e6096b74e7","resolution":{"observed_at":"2026-08-11T14:59:13.117690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T14:59:12.161810Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.161810Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:f2330d8d6a6dae9dec9a269c4bd15f56a9c2812a60bfec82a8cf99e8b0820948","observation_id":"564c92a3-b4ae-40ee-ae6c-fa07150f4530","resolution":{"observed_at":"2026-08-11T14:59:12.161810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23363","last_updated":"2025-05-29T11:40:34Z","snapshot_observed_at":"2026-08-13T15:07:02.007842Z","submitted_at":"2025-05-29T11:40:34Z","title":"Discriminative Policy Optimization for Token-Level Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23363","snapshot_observed_at":"2026-08-11T14:59:12.070055Z","title":"Bootstrapping language models with DPO implicit rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.070055Z"},"links":{"cited_paper":"/paper/2505.23363","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:23b4a5235a68d04c0c9e88dd7d4c6523efba46444177139852ee13ba8d33f5e2","observation_id":"959f098a-23bb-411c-9ad1-170ba632a6f2","resolution":{"observed_at":"2026-08-11T14:59:12.070055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-11T14:59:12.114561Z","title":"Step- dpo: Step-wise preference optimization for long-chain reasoning of llms.arXiv preprint arXiv:2406.18629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.114561Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:f1f4837cc0dcf269e258e12b9d3a882223e1224e593f20405e91d92261892460","observation_id":"e050620a-34d5-46d5-b4d6-852f9bc765c1","resolution":{"observed_at":"2026-08-11T14:59:12.114561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T14:59:12.063432Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.063432Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:d53483d5711ed03027e4f75a0fdd23ecd9181ae0f35ea3068d9058e68a1ad7e9","observation_id":"aa42e25b-f3b6-4a78-bc79-2cee2585bf2e","resolution":{"observed_at":"2026-08-11T14:59:12.063432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-11T14:59:12.083599Z","title":"Kawin Ethayarajh, Winnie Xu, Niklas Muennighoff, Dan Jurafsky, and Douwe Kiela","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.083599Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:934c1ae74a50a1422d1ff78ec8d8607c0445d78bb7c3be2d9f5115f2c4328a51","observation_id":"f4e325dd-45d5-4f10-88c2-f9f7f3e02579","resolution":{"observed_at":"2026-08-11T14:59:12.083599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-11T14:59:12.096578Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.096578Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:bdf3869301f793a59b9a4b07efe63ecd3765d43874bd851311d672aecb9ea92b","observation_id":"de9a80bd-8553-44e9-b2f7-41399341a89c","resolution":{"observed_at":"2026-08-11T14:59:12.096578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T07:03:37.279436Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2608.09568."}