{"as_of":"2026-08-15T15:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3743b547f64398be9bcb5869325613544a07f51caab00f70ed5066107d24d735","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:05:26.862251Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.15894/citation-record","integrity":"/paper/2602.15894/integrity","json":"/paper/2602.15894/citation-record.json","paper":"/paper/2602.15894"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04318","last_updated":"2025-02-26T17:51:31Z","snapshot_observed_at":"2026-08-13T15:40:19.404753Z","submitted_at":"2024-12-05T16:34:20Z","title":"The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04318","snapshot_observed_at":"2026-08-03T01:05:25.931091Z","title":"The hyperfitting phenomenon: Sharpening and stabilizing llms for open-ended text generation.arXiv preprint arXiv:2412.04318,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:25.931091Z"},"links":{"cited_paper":"/paper/2412.04318","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:a843e2214d805949af05d346f63b03e9a99d054ba69f3a246c38579e767ba35c","observation_id":"14262ad3-f793-40f6-82a3-2fdc91bf01c6","resolution":{"observed_at":"2026-08-03T01:05:25.931091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T01:05:26.065231Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.065231Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:c6500bbf8b596046abdd216f094f8bc929b6e3f1c1092871b39495867a770582","observation_id":"1b6c57f4-cddc-45ac-9548-d6f77e4e7b58","resolution":{"observed_at":"2026-08-03T01:05:26.065231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10271","last_updated":"2025-07-25T21:23:51Z","snapshot_observed_at":"2026-08-14T05:33:42.303481Z","submitted_at":"2024-12-13T16:46:03Z","title":"Benchmarking Linguistic Diversity of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10271","snapshot_observed_at":"2026-08-03T01:05:26.105939Z","title":"Benchmarking linguistic diversity of large language models.arXiv preprint arXiv:2412.10271,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.105939Z"},"links":{"cited_paper":"/paper/2412.10271","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:72376169b157c1a5000b41acfa380f1754298919dba285b5745263bd9ad3ef76","observation_id":"324fc313-9ff8-4574-be95-66ff29ff372a","resolution":{"observed_at":"2026-08-03T01:05:26.105939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T01:05:26.157112Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.157112Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:1a599f98eb49ff9dc889d595b3bb4be387a045dcee817600305282d2a021eacd","observation_id":"ab766472-f296-4cd2-aa58-0dad06b08328","resolution":{"observed_at":"2026-08-03T01:05:26.157112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:05:26.269779Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.Meta AI Blog","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.269779Z"},"links":{"citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:76dd48fabbfd676ad0fcbadc4914668876fa9d361209c65e295a672f5fb94b4d","observation_id":"de76183d-5471-4896-a0cb-a9876e4efa29","resolution":{"observed_at":"2026-08-03T01:05:26.269779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04427","last_updated":"2025-07-07T18:34:06Z","snapshot_observed_at":"2026-08-12T22:05:59.739470Z","submitted_at":"2024-11-07T04:38:58Z","title":"One fish, two fish, but not the whole sea: Alignment reduces language models' conceptual diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04427","snapshot_observed_at":"2026-08-03T01:05:26.300374Z","title":"One fish, two fish, but not the whole sea: Alignment reduces language models’ conceptual diversity.arXiv preprint arXiv:2411.04427,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.300374Z"},"links":{"cited_paper":"/paper/2411.04427","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:5510af44b6a7301c64b8a85e517a6d71c508f3aa0bd8916b366ddc09dfc8ea22","observation_id":"1cb8f421-bf9c-4558-a239-293ff200129e","resolution":{"observed_at":"2026-08-03T01:05:26.300374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13373","last_updated":"2021-10-26T03:04:00Z","snapshot_observed_at":"2026-08-14T05:47:22.083784Z","submitted_at":"2021-10-26T03:04:00Z","title":"EnTRPO: Trust Region Policy Optimization Method with Entropy Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13373","snapshot_observed_at":"2026-08-03T01:05:26.382864Z","title":"Entrpo: trust region policy optimization method with entropy regularization.arXiv preprint arXiv:2110.13373,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.382864Z"},"links":{"cited_paper":"/paper/2110.13373","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:df69d71da27d5b4d06c99a67c16aa8d4ddaaae0ea16ae9f02a81aa747d8e416f","observation_id":"59eb3f4c-8325-41e5-8839-808737117e40","resolution":{"observed_at":"2026-08-03T01:05:26.382864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11463","snapshot_observed_at":"2026-08-03T01:05:26.423214Z","title":"Curiosity-driven reinforcement learning from human feedback.arXiv preprint arXiv:2501.11463,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.423214Z"},"links":{"cited_paper":"/paper/2501.11463","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:4b42395f4dc09a1bda2de48144801dc0d9b966f1771bf66dd39f902137d634ba","observation_id":"8ba30e36-23e4-44aa-bc17-7e45b0c1344d","resolution":{"observed_at":"2026-08-03T01:05:26.423214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-15T09:26:05.847971Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-03T01:05:26.526082Z","title":"Zephyr: Direct distillation of lm alignment.arXiv preprint arXiv:2310.16944,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.526082Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:c9514db23eaaa110b373341e82b4567b936d5a42c7b13e2291952493559676e6","observation_id":"73a7d633-264e-4bb9-8e32-d8f4eb74b6e8","resolution":{"observed_at":"2026-08-03T01:05:26.526082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09654","last_updated":"2025-08-13T09:37:53Z","snapshot_observed_at":"2026-08-13T10:13:04.105948Z","submitted_at":"2025-08-13T09:37:53Z","title":"Improving Diversity in Language Models: When Temperature Fails, Change the Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09654","snapshot_observed_at":"2026-08-03T01:05:26.587811Z","title":"Improving diversity in language models: When temperature fails, change the loss.arXiv preprint arXiv:2508.09654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.587811Z"},"links":{"cited_paper":"/paper/2508.09654","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:7243a5716ed07137f878d24fe2d66766eee946b2a609304a3b2ee808cdf3a524","observation_id":"96123e1f-eb81-4f60-b6d8-dddf9424ba72","resolution":{"observed_at":"2026-08-03T01:05:26.587811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:05:26.649957Z","title":"Diversity-oriented data augmentation with large language models.arXiv preprint arXiv:2502.11671,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.649957Z"},"links":{"citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:dd278d2620e68fe09e64373ca2e878bc351ae0011a1bb54994b436cfa582ff1b","observation_id":"1923558e-a596-44dd-848e-4e2abe2cbf80","resolution":{"observed_at":"2026-08-03T01:05:26.649957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17965","last_updated":"2025-03-23T07:03:10Z","snapshot_observed_at":"2026-08-11T21:41:44.260666Z","submitted_at":"2025-03-23T07:03:10Z","title":"Understanding the Effects of RLHF on the Quality and Detectability of LLM-Generated Texts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17965","snapshot_observed_at":"2026-08-03T01:05:26.711004Z","title":"Understanding the effects of rlhf on the quality and detectability of llm-generated texts.arXiv preprint arXiv:2503.17965,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.711004Z"},"links":{"cited_paper":"/paper/2503.17965","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:1c8b6e436f583396c8c0bc97e5a6ea69d85ecbc1b22021c9464ebbd11e11c869","observation_id":"04f5bc96-1512-40fd-a245-7e7e8c4b39c6","resolution":{"observed_at":"2026-08-03T01:05:26.711004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T01:05:26.772492Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.772492Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:ae69fae202214abc4a8c143870c24786851ec07d40bfa8662dda17383c00b238","observation_id":"621fba89-e0af-45d2-9940-4854dda28128","resolution":{"observed_at":"2026-08-03T01:05:26.772492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:05:26.831986Z","title":"Gvpo: Group variance policy optimization for large language model post-training.arXiv preprint arXiv:2504.19599,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.831986Z"},"links":{"citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:2ff91f1b7f011c47c6b54b2efd0d2b4e4812c9e6aca8c3b883d9fef966d31462","observation_id":"c6a94ba0-275f-4af2-a161-fbb381039acf","resolution":{"observed_at":"2026-08-03T01:05:26.831986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13586","last_updated":"2025-01-08T02:09:15Z","snapshot_observed_at":"2026-08-12T22:58:09.378548Z","submitted_at":"2024-08-24T14:14:32Z","title":"Balancing Diversity and Risk in LLM Sampling: How to Select Your Method and Parameter for Open-Ended Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13586","snapshot_observed_at":"2026-08-03T01:05:26.862251Z","title":"Balancing diversity and risk in llm sampling: How to select your method and parameter for open-ended text generation.arXiv preprint arXiv:2408.13586,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.862251Z"},"links":{"cited_paper":"/paper/2408.13586","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:e78c6363f14dc3f01449ceffe21a482fff96ccb488bc336962342b6a10044237","observation_id":"fb2d0947-1140-4751-840c-0d1ce9197c10","resolution":{"observed_at":"2026-08-03T01:05:26.862251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T01:05:26.460098Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.460098Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:604f60e6b231f21b8b27e13a6f73aaef1c74d094bcb09ed83aba6afa6c4e40f8","observation_id":"e13cc707-0d98-477d-9743-5a4d3dd6cc0b","resolution":{"observed_at":"2026-08-03T01:05:26.460098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-08-14T15:51:49.712613Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-03T01:05:26.197993Z","title":"Understanding the effects of rlhf on llm generalisation and diversity.arXiv preprint arXiv:2310.06452,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.197993Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:04887dff9bfdbe589c1b6cef71d36dcd603a68878df0d43ef1ffc59784e2b7aa","observation_id":"b65e7330-a004-4772-9c64-4fb025066304","resolution":{"observed_at":"2026-08-03T01:05:26.197993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05196","last_updated":"2024-07-01T16:36:30Z","snapshot_observed_at":"2026-08-13T10:16:58.264595Z","submitted_at":"2023-09-11T02:16:47Z","title":"Does Writing with Language Models Reduce Content Diversity?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05196","snapshot_observed_at":"2026-08-03T01:05:26.339411Z","title":"Does writing with language models reduce content diversity? arXiv preprint arXiv:2309.05196,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.339411Z"},"links":{"cited_paper":"/paper/2309.05196","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:5df75d4cdff83b107130d3c3cf568a97ae5c7d4f2a26bff5ed85ca6ba3a44fa9","observation_id":"3b5cd43f-b90e-4aa1-b8d1-b1246c6f8a49","resolution":{"observed_at":"2026-08-03T01:05:26.339411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18101","last_updated":"2025-05-22T17:50:19Z","snapshot_observed_at":"2026-08-12T14:29:08.482175Z","submitted_at":"2025-01-30T02:47:41Z","title":"Diverse Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18101","snapshot_observed_at":"2026-08-03T01:05:26.232865Z","title":"Diverse preference optimization.arXiv preprint arXiv:2501.18101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.232865Z"},"links":{"cited_paper":"/paper/2501.18101","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:7239d40c61ca7f36f06a87195efafeb549a54a61197f5219eb2e88dbb1616f2a","observation_id":"5860c44c-c0b3-4885-bd08-0a9d9dc6c7d8","resolution":{"observed_at":"2026-08-03T01:05:26.232865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:05:25.973071Z","title":"xverify: Efficient answer verifier for reasoning model evaluations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:25.973071Z"},"links":{"citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:62af7182c29130fe68b6d9d811d44cfbbbe2e22bd7b35887eab221cf390e28f6","observation_id":"2e40642a-8b54-48b6-9df4-79f0281f402b","resolution":{"observed_at":"2026-08-03T01:05:25.973071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-03T01:05:26.003252Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T01:05:26.003252Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2602.15894"},"observation_digest":"sha256:752d325ad5640a89ac5d1375e75ce9c4d8d63abcac618ad774d1cbc7d58b7371","observation_id":"d0d23ebb-b93f-4398-8aea-a9fa06967d02","resolution":{"observed_at":"2026-08-03T01:05:26.003252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.15894","last_updated":"2026-05-27T12:13:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:18:40.608375Z","submitted_at":"2026-02-11T10:28:50Z","title":"Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2602.15894."}