{"as_of":"2026-08-16T02:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd4a645be3a590238f476fd8f1b4e4d2b2073cb2f1f40e1bac2d5e0f34bbb8a4","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:33:57.230753Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07419/citation-record","integrity":"/paper/2608.07419/integrity","json":"/paper/2608.07419/citation-record.json","paper":"/paper/2608.07419"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.754591Z","title":"Proceedings of the International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.754591Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:afdc82cf5545040774457b8bd18870f83ed62aca9331a422664ad869cc2cfb59","observation_id":"af725466-9290-4f15-945c-c41b9016e78f","resolution":{"observed_at":"2026-08-15T14:33:56.754591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.760515Z","title":"Proceedings of the Conference on Health, Inference, and Learning (CHIL) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.760515Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:60368ddb74d8a783a9c3977365919ed12b09f2e30732e377c90ad0182fe08ef1","observation_id":"9e11b084-d823-4566-b3cb-1899c01bb4a3","resolution":{"observed_at":"2026-08-15T14:33:56.760515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.765856Z","title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.765856Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:a9db22919c1d880e9630ecb01a668d91a0d35a3fedae63a726135b35cc810a6a","observation_id":"8e3f9fe9-299f-43d8-8a86-5f5084637103","resolution":{"observed_at":"2026-08-15T14:33:56.765856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.770554Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.770554Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:563bcd7b271e553a6608f78a095e9f70b0e8dcb6b4e6c3f7eac8b8b75d035829","observation_id":"2f22d196-231b-4bd2-ab90-14a380b7b042","resolution":{"observed_at":"2026-08-15T14:33:56.770554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.775387Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.775387Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:456c51503d84525a122f63be0b814d740225c908f64a4db8a9bbbf5aac3abb14","observation_id":"f2e27860-9240-4fec-a9b2-d78ee688846f","resolution":{"observed_at":"2026-08-15T14:33:56.775387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.780891Z","title":"See https://vicuna","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.780891Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:b785eb177e423b09cd07daabe9abd75f19d57c200cb3c3545a4c870d7d430e89","observation_id":"a80c003c-ef58-4b3d-83a1-b7e416fb3b77","resolution":{"observed_at":"2026-08-15T14:33:56.780891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T14:33:56.785705Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.785705Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:52b066667dc99f01644be4eecc0973874e4a5da7d1f861c135c2efd7c5e2fafc","observation_id":"df87f760-94bf-4307-951c-f680c6274283","resolution":{"observed_at":"2026-08-15T14:33:56.785705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-15T14:33:56.791884Z","title":"arXiv preprint arXiv:2310.06825 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.791884Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:92a273ed56f83dcd11fc498b6718aad664d2d636d9c57cec9ae6db0c59cba081","observation_id":"d3d55bce-1982-437d-9060-c4c965a9c3bb","resolution":{"observed_at":"2026-08-15T14:33:56.791884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-15T14:33:56.796696Z","title":"arXiv preprint arXiv:2408.00118 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.796696Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:6bd111a265a4ff17b3ffcb6202ea8288a0b3c9fc137f34c6c8501a6a6e01d6b2","observation_id":"6aa7d3ca-5bd3-46b9-943c-80de4e7e29f7","resolution":{"observed_at":"2026-08-15T14:33:56.796696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-15T14:33:56.801493Z","title":"arXiv preprint arXiv:2501.00656 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.801493Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:db17ce37f94edfbc118b9a0a2fa67dc31c9eab45a6062a6cdd5b3459bbaa6a7f","observation_id":"7eb5ac86-6185-4073-9f70-fa6dd6563a14","resolution":{"observed_at":"2026-08-15T14:33:56.801493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T14:33:56.806565Z","title":"arXiv preprint arXiv:2411.15124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.806565Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:9e274e648453aaf8368765e37a6ab5ceef0a0a798ca8fddb89cbe2dd75c68868","observation_id":"cffbec35-f61b-4bf4-8211-eec3f6d70f88","resolution":{"observed_at":"2026-08-15T14:33:56.806565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.811359Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.811359Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:dc58046f15ef43f793223d8e0bd74254fe5c37f64c7c699b7bfd1a9a4e2978e3","observation_id":"7f79b5be-e89d-454e-ab4d-c9b1ab1bd94b","resolution":{"observed_at":"2026-08-15T14:33:56.811359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06548","last_updated":"2017-01-23T18:35:28Z","snapshot_observed_at":"2026-08-14T21:19:55.038511Z","submitted_at":"2017-01-23T18:35:28Z","title":"Regularizing Neural Networks by Penalizing Confident Output Distributions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06548","snapshot_observed_at":"2026-08-15T14:33:56.816397Z","title":"arXiv preprint arXiv:1701.06548 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.816397Z"},"links":{"cited_paper":"/paper/1701.06548","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:9d2654a2985907c6d1ce4c1af90e666ad3ec98e94fb06b7cc4f6ebb9be3b1764","observation_id":"dc58164b-999d-43dc-be7c-afc4ba89f1b4","resolution":{"observed_at":"2026-08-15T14:33:56.816397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.821577Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.821577Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:43ed0abe89dbce0f37eaf510b8b6c833fa8f82f31b0c8793d1c3828353434b3d","observation_id":"ad098449-90b8-422c-ac0d-ef6f187875b5","resolution":{"observed_at":"2026-08-15T14:33:56.821577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.825943Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.825943Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:5dfd28b63339ee9c7abd334b7982d5d30c06de428af1b6cfc0ef7cf405ea4563","observation_id":"37d044b7-be8d-42fc-8f9d-dbd4660254e0","resolution":{"observed_at":"2026-08-15T14:33:56.825943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.830329Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.830329Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:b585a0c1a7523db12993456cdf6e94ba41001895e414930a8d54816a1fe4e0d5","observation_id":"2ed7946f-e95e-4126-a3e2-d660359bc3e6","resolution":{"observed_at":"2026-08-15T14:33:56.830329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.835665Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.835665Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:8330e8bf00bf6f0ac188f4f5ea8c6be6c80d65ac3773805708781d5877906ebb","observation_id":"7a7116e4-d601-4651-87c6-cdb5f7fcb6db","resolution":{"observed_at":"2026-08-15T14:33:56.835665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.840426Z","title":"Crafting Papers on Machine Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.840426Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:0a1a506ba4e650cfe6dec6cda527024999c15cff398d2f13707d77e470482743","observation_id":"c3fb7bf6-617c-4351-a0d7-04318b68b08c","resolution":{"observed_at":"2026-08-15T14:33:56.840426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.845192Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.845192Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:f7e8efb18992459409c526d80b99e14fdf15ed4fc05a2b741ba36748f0038821","observation_id":"13586f06-ca81-432d-8109-8a921696b338","resolution":{"observed_at":"2026-08-15T14:33:56.845192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.849548Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.849548Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:d15f2902faa45afd56fe268f43d56a65c3af1b39a2554813aa4e2b4b91f4d1d6","observation_id":"133f46fa-b49d-4f50-8661-ea6cd2b914b1","resolution":{"observed_at":"2026-08-15T14:33:56.849548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.854015Z","title":"I , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.854015Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:545b53678f63167644b6a7995e7bfa3ee0caa151b7ac9247a00100940af18dac","observation_id":"9725683b-da24-411f-adda-270c3772baf0","resolution":{"observed_at":"2026-08-15T14:33:56.854015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.859504Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.859504Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:4e00502aa06d8f083d839e731c25bbd0b1642629af7c1e31462f080d39a99eed","observation_id":"3608e0a3-59c6-459d-90cf-1f6f97131bd9","resolution":{"observed_at":"2026-08-15T14:33:56.859504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.864054Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.864054Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:55bed0abbe143a3f2af69a4258245af8d6b165be908fe1578088a97f18c22ee2","observation_id":"a164cdb9-0fba-44ad-967b-1996a48c06e8","resolution":{"observed_at":"2026-08-15T14:33:56.864054Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.868465Z","title":"Newell and P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.868465Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:996b3e9f5badc8a16d1c968a9373befa29eebc3b94a2941804be8c83718d5780","observation_id":"ec7fe7f1-aeee-4450-9bad-a2e9fcb57610","resolution":{"observed_at":"2026-08-15T14:33:56.868465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.872829Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.872829Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:b4d8e7c58d43fc8dfd1551741477c58f9ce9d4c0858b311d3af26dab66d05aa6","observation_id":"47445272-8dd4-4d1a-8f89-584d8f2450f8","resolution":{"observed_at":"2026-08-15T14:33:56.872829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.877320Z","title":"On divergences and informations in statistics and information theory , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.877320Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:9ec71c7699094d6d13d1518d93e0f0f4d6745e84563cb6aade97b5dcc8f95711","observation_id":"22e67784-00d7-462f-b475-ab78ac4b01cb","resolution":{"observed_at":"2026-08-15T14:33:56.877320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.882133Z","title":"doi:10.57967/hf/0181 , publisher =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.882133Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:cd4cb3d8104d29dce3f07c2338fdb3bb2819377a51f7d9ecb7c415057bc0b366","observation_id":"11ebb4b4-ad36-4f2e-8c7e-b8eec46f25ec","resolution":{"observed_at":"2026-08-15T14:33:56.882133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.887637Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.887637Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:d331f9d64fb6258e24619ddac97f65ddd8adc00efc1562576d18c13069f6aa27","observation_id":"dcd8613b-c205-4a7c-b2d9-30920badb89e","resolution":{"observed_at":"2026-08-15T14:33:56.887637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.892919Z","title":"f -divergences , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.892919Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:7bd1423f49c2d08f91fdb50929cbdaba6538c4d8b677c279f82637224a0ff555","observation_id":"1d7150da-7029-471f-9ab8-94039aa83bb7","resolution":{"observed_at":"2026-08-15T14:33:56.892919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.897264Z","title":"Convex analysis , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.897264Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:17c82d12fc62e1171159f1fa844b8d4e61369faead767e27062d955931737d29","observation_id":"a44610d4-cdd0-4dd5-a47b-40a3926e721a","resolution":{"observed_at":"2026-08-15T14:33:56.897264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.901774Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.901774Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:9553b2de7b9d947b0ce7dee096dd3a9d5c6c22c07776b89bfc860bebc8e5059b","observation_id":"6dfd3eb2-0445-4710-81e3-ddc75e361355","resolution":{"observed_at":"2026-08-15T14:33:56.901774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.906462Z","title":"Convex optimization , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.906462Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:03ef8c0276192b061fe8328a1577361dbe756c39488e0a111640de7aca6f7e10","observation_id":"e07a24ba-d01c-4c36-bd77-a5047ea44ac4","resolution":{"observed_at":"2026-08-15T14:33:56.906462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.910999Z","title":"Convex analysis and minimization algorithms I: Fundamentals , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.910999Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:6f8011b1eaa2510fba9e154a5f0e4aeaa4f3fa1e65769176b2e16ed3ca203c9b","observation_id":"70a453ea-daed-4821-92b3-aabd6ce3414a","resolution":{"observed_at":"2026-08-15T14:33:56.910999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.915692Z","title":"Information theory and statistics: A tutorial , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.915692Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:c837dad8a86510d8b344267a7420b79a17ddf21063cd5eb4fd76ac43fa492789","observation_id":"73914b37-fabf-4f95-9d74-f6e1057c9b76","resolution":{"observed_at":"2026-08-15T14:33:56.915692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.920473Z","title":"Entity-level Factual Consistency of Abstractive Text Summarization , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.920473Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:7aa357f4daec0b4aa5ca1a2094af6261dde53090cd5e633fb9e02bd60330fdf6","observation_id":"fc6638d6-7600-4191-9d5e-78ff94bbfe25","resolution":{"observed_at":"2026-08-15T14:33:56.920473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.925665Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.925665Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:e2b7d2f543e4dcd5ec96abe495ac75919d9e4f91662f0744ad7ad63a81c56858","observation_id":"8983a345-2c2a-402e-a1f7-bb8bff26921b","resolution":{"observed_at":"2026-08-15T14:33:56.925665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.930773Z","title":"A Distributional Approach to Controlled Text Generation , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.930773Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:4ad0892c8de98109cb027441d422566eb7aae3f187f9841c964268cc783ec821","observation_id":"4ca715bd-1961-40e9-b363-252bcf824167","resolution":{"observed_at":"2026-08-15T14:33:56.930773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.935545Z","title":"f -divergence Inequalities , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.935545Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:f3a81b61c411353954306bcbee0968848f18677733fea5056c15fabcaf56e2f7","observation_id":"2ada9f43-48e6-4230-9486-f708cabd444d","resolution":{"observed_at":"2026-08-15T14:33:56.935545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.940134Z","title":"Neural Text Generation from Structured Data with Application to the Biography Domain , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.940134Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:61c53a7a2e3fa898906194da1a403d240afef033ea1c4126b04875ccf668a29d","observation_id":"9e65c88f-31e1-42e8-8e03-e10c025ce026","resolution":{"observed_at":"2026-08-15T14:33:56.940134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.944614Z","title":"Controlling Conditional Language Models without Catastrophic Forgetting , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.944614Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:4658e082e021be45ec9b1b6af9221d03907be510f153aa457158fc67357d4380","observation_id":"8fba8887-8540-44d4-9242-c5b402b1085c","resolution":{"observed_at":"2026-08-15T14:33:56.944614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.949430Z","title":"On f-divergences: Integral representations, local behavior, and inequalities , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.949430Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:cb566e8fbc5009942fed83c46f0f909730bf47707a752e4ef9c55e6584e3f14d","observation_id":"eb6ec6b5-8d69-485d-b95b-bb33af3f661f","resolution":{"observed_at":"2026-08-15T14:33:56.949430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.955238Z","title":"and Della Pietra, Stephen A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.955238Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:b43202e239159481cb0f1c6b44dd83cff79b8160dfdbb5bbb5b72d86d45a2177","observation_id":"66500632-7ace-4fa9-8ba2-c43b7a3fa659","resolution":{"observed_at":"2026-08-15T14:33:56.955238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.961888Z","title":"Abstractive Text Summarization using Sequence-to-sequence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.961888Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:1bf0690b48763380798d3eafe36866d7f34225fdd6c3e2ed84de635f1cd05002","observation_id":"99d027bb-6cfb-4939-9678-84defc74eedf","resolution":{"observed_at":"2026-08-15T14:33:56.961888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.966741Z","title":"Variational Inference with Tail-adaptive f-Divergence , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.966741Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:85f486460e093c7e539cdfe21567d78cfcdce1a97a783be24fb762689fde8f0a","observation_id":"603b9ee9-fb85-4864-b3c2-dc8190b30522","resolution":{"observed_at":"2026-08-15T14:33:56.966741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.971646Z","title":"Transformers: State-of-the-Art Natural Language Processing , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.971646Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:e35557f801e8167e92a57e50542cd4bd7f59987e4155262276b86e9e3034a783","observation_id":"cf5d80f1-5906-4b5c-8170-314ec6446b1d","resolution":{"observed_at":"2026-08-15T14:33:56.971646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.977001Z","title":"Kingma and Jimmy Ba , bibsource =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.977001Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:40302e30aa016d5cab09aea2520ffae0eb4e4c3cb24969a409999e7ac8339a34","observation_id":"6cd59760-014e-4013-ae40-108adc79d6fd","resolution":{"observed_at":"2026-08-15T14:33:56.977001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.981700Z","title":"Hierarchical Neural Story Generation , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.981700Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:3adbe1d3b9ffa7a777b7c35b0f75eebc95973fa6bda22bba23c887cd5acf6b17","observation_id":"80df0a53-8348-45cd-9fbe-42b5eb8c674c","resolution":{"observed_at":"2026-08-15T14:33:56.981700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.986825Z","title":"Courville and Yoshua Bengio , bibsource =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.986825Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:9dc487ec215eceba9ff012d01295c6e6dd3d43883de478d205280a1fc2e4dbc7","observation_id":"1618b06e-e1ac-48ae-a4e6-b2b3f1a81c80","resolution":{"observed_at":"2026-08-15T14:33:56.986825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d17-1103","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:58.671180Z","title":"Reinforced Video Captioning with Entailment Rewards , url =","venue":null,"work_id":"e94cb6cb-90b4-4b66-94af-8d93587f087a","year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.991526Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:5b6d797fc0c93af7165cf24139a74d508e932cd2397f90ca9a4a084baa38b944","observation_id":"14272aab-278f-4891-bed9-604ade5b16e3","resolution":{"observed_at":"2026-08-15T14:33:58.676702Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:56.996295Z","title":"Martin and Animesh Mehta and Brent Harrison and Mark O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:56.996295Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:1910c0b22794e2b35c8975c739a57099c7a76a59abac76b78602b186844bf319","observation_id":"eeaa4754-cf5f-4569-b9b4-df93ea0ff529","resolution":{"observed_at":"2026-08-15T14:33:56.996295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.001104Z","title":"Deep Reinforcement Learning for Dialogue Generation , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.001104Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:b7320701bb08b63051511fb26550190a1d9ca2e734b169048e88de956d64b853","observation_id":"e6de71c6-17ad-4c20-89a8-d350c81a0159","resolution":{"observed_at":"2026-08-15T14:33:57.001104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.006306Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.006306Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:5f7c683e24fe651607ba3aad42591f81a13e916dd0c9fd2cbca67d4e623045dc","observation_id":"e0a22e36-0ccc-4ac1-9d23-80dfbd87db62","resolution":{"observed_at":"2026-08-15T14:33:57.006306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.011934Z","title":"The 22nd international conference on artificial intelligence and statistics , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.011934Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:8822be96275353024af997194af792f6081d350d61c31ae9a1443b07e2b811dd","observation_id":"8a37dd86-a5c6-4c04-baee-4a8d340099d1","resolution":{"observed_at":"2026-08-15T14:33:57.011934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.016719Z","title":"Proceedings of the eighth ACM SIGKDD international conference on Knowledge discovery and data mining , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.016719Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:2a5459afacad3dfa5c10f1fcdc57602f49f384a9b4266ce6be40c935af3eb73f","observation_id":"795db5b7-8a60-445c-a8b8-e2eea2430f00","resolution":{"observed_at":"2026-08-15T14:33:57.016719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.021187Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.021187Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:58171cf789eaefbe1ef46141ac41b83243da6fd6570ed399b825cf8c9af5bab1","observation_id":"08af63a5-afd3-4df9-929e-a5a1a58285a7","resolution":{"observed_at":"2026-08-15T14:33:57.021187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.025622Z","title":"Probabilistic model for code with decision trees , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.025622Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:ef4b4f19c6a05e7fd0b6b1f3a0b4ab63c93a67ec9bb71dbccd907f5f73d1701d","observation_id":"f4d1b4f3-44fe-43d4-8591-9d5c5178ff37","resolution":{"observed_at":"2026-08-15T14:33:57.025622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.030193Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.030193Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:0a10a722d547e42b3f4b293cea4a39d8dd080fd322f653672a44d03911e0feba","observation_id":"333c779c-0e91-42da-8d16-e4203a3d7c78","resolution":{"observed_at":"2026-08-15T14:33:57.030193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.035472Z","title":"The Woman Worked as a Babysitter: On Biases in Language Generation , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.035472Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:514e2e0b5263b71e9254019d095c1fb0cda93f20754b18b30bae372d56a9226b","observation_id":"886d4348-b592-438e-83b1-3b0d9d7d65b0","resolution":{"observed_at":"2026-08-15T14:33:57.035472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.040366Z","title":"On Reinforcement Learning and Distribution Matching for Fine-Tuning Language Models with no Catastrophic Forgetting , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.040366Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:cb3aa3a0690af84dceeb1a1a73a4f0a4d6885778d9f24ce7caa3c3e4938707b3","observation_id":"77d41182-0132-48d8-b0f8-f9e096566577","resolution":{"observed_at":"2026-08-15T14:33:57.040366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.044750Z","title":"and Daly, Raymond E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.044750Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:ffc7c840555712e9d2c64002fe6905ed74abed7728a17b47e79d639e978695eb","observation_id":"c59686d4-492c-4e00-a68d-64db87a13d28","resolution":{"observed_at":"2026-08-15T14:33:57.044750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.049239Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.049239Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:6fc3c6dace839246bc0fb4ad4c4debc7f938fc02d26dc12bd485b7e4d2d09d31","observation_id":"515bfea2-c573-4a9d-b4dd-47fa65f60e5f","resolution":{"observed_at":"2026-08-15T14:33:57.049239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.054203Z","title":"Texygen:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.054203Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:de8c937d4b85c10c09375109a2c667d91e28be15c977bb6b0f52b3ec9783f15a","observation_id":"0097746b-eb61-4127-9a7d-5b600d90a76a","resolution":{"observed_at":"2026-08-15T14:33:57.054203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.058932Z","title":"Language models are unsupervised multitask learners , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.058932Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:13f1c877008836ddf272133568bba35d23c00874c6118b8b6f6dcba384cb36b8","observation_id":"377d0c24-1af0-48c5-9d36-ce216aacb8bc","resolution":{"observed_at":"2026-08-15T14:33:57.058932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.063622Z","title":"Fine-tuning language models from human preferences , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.063622Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:0f8b54c1816c05f1dc2490dc8b7ed271889be7afb4e5185e437bffd765a0d597","observation_id":"e133c8c4-05ff-4a2f-8e70-5e3ee4cebae2","resolution":{"observed_at":"2026-08-15T14:33:57.063622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.068199Z","title":"A tutorial on energy-based learning , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.068199Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:e33e06f7fe52efd824b6201cbe3db7a4bd36a596154f3f74f4b742a6014c8008","observation_id":"7b3eb115-6dc7-4076-ab9c-af3e90efe1ef","resolution":{"observed_at":"2026-08-15T14:33:57.068199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.072749Z","title":"Infinite-horizon policy-gradient estimation , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.072749Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:939c9b58e5f3e6d4647c73c8c8c5b11d0c8a9cae2f10530737ded2bf706b709b","observation_id":"d9ac53cb-1d7b-4373-bc8b-23b18acc9d09","resolution":{"observed_at":"2026-08-15T14:33:57.072749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.077661Z","title":"Training products of experts by minimizing contrastive divergence , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.077661Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:909e5e87da3a50222a757d5e8a999b0a1a179f442d4b289e65977fbb7f6bff93","observation_id":"f71c6baa-4521-4a2b-b438-6766908931be","resolution":{"observed_at":"2026-08-15T14:33:57.077661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.082525Z","title":"Global Autoregressive Models for Data-Efficient Sequence Learning , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.082525Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:31fbea2ae873988fd9819b5ee9f5f84c5be9d37d8614586062afb403b870dc8c","observation_id":"31319ff9-598f-4265-b608-53e7e517caf1","resolution":{"observed_at":"2026-08-15T14:33:57.082525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.087122Z","title":"Distributional reinforcement learning for energy-based sequential models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.087122Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:3fec901fcc65402f0da44572f1660fafa12ceff41da133dbf426dcb8768c4c0d","observation_id":"cdd30e56-690e-451e-9f59-4f7d83b5bbfa","resolution":{"observed_at":"2026-08-15T14:33:57.087122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-15T14:33:57.091820Z","title":"Riedmiller , bibsource =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.091820Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:9df96a12c1caf72b5258b6fade0f8b70454b45f0d33aed707e0cd7bda9a2f068","observation_id":"eb4ed9cf-7b0a-4607-801e-28ac78ec5b19","resolution":{"observed_at":"2026-08-15T14:33:57.091820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.096994Z","title":"Jordan and Pieter Abbeel , bibsource =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.096994Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:7d3bb0b29a6606dd17ab4751dd4af155e64ddb3c3e7cd8304297bb4eac46a9e0","observation_id":"c40c249d-cfcb-46f2-a26b-7b2a0e6cbb81","resolution":{"observed_at":"2026-08-15T14:33:57.096994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.101378Z","title":"Proximal policy optimization algorithms , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.101378Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:1ce3a2f5f284e4e411194548ec1aeb1ebd85033fb6ac32da4c2682c4e07c94f1","observation_id":"1291f08b-1d02-4198-82be-ff4d2e265bd0","resolution":{"observed_at":"2026-08-15T14:33:57.101378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.106144Z","title":"Tuning recurrent neural networks with re-inforcement learning , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.106144Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:afecb82e3b686d6671623fde5fd3cf055470298aa628fbbe5cb752b395bfef61","observation_id":"4dc043b5-aa07-427b-9035-45c680e84baa","resolution":{"observed_at":"2026-08-15T14:33:57.106144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.110689Z","title":"COLD decoding: Energy-based constrained text generation with langevin dynamics , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.110689Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:8c21204e476bba921f21a7d4dde48eba40e0db07c4cb0f2c45ea66073320548e","observation_id":"2653d197-cdc4-4909-bc17-f92f2dc3a9fe","resolution":{"observed_at":"2026-08-15T14:33:57.110689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.115452Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.115452Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:f1020e7c661da8c679a5a521e90d9bbbe072f899674840560717da3bad3353bc","observation_id":"52cfd967-72cf-4d9d-8f9c-5e7ad3e63526","resolution":{"observed_at":"2026-08-15T14:33:57.115452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.119906Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.119906Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:98dd32f6446af11d5b2545d7502f7e3119b5db7be886a28782cbae1f78f24da4","observation_id":"04723fb0-6279-4275-9378-4a4ebf0c23c5","resolution":{"observed_at":"2026-08-15T14:33:57.119906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11275","last_updated":"2022-10-21T10:24:00Z","snapshot_observed_at":"2026-08-14T00:54:57.734753Z","submitted_at":"2022-05-23T12:47:13Z","title":"RL with KL penalties is better viewed as Bayesian inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11275","snapshot_observed_at":"2026-08-15T14:33:57.124460Z","title":"Buckley , bibsource =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.124460Z"},"links":{"cited_paper":"/paper/2205.11275","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:f94519dcd7cb1a4fdf5505e4609439ad636d8fb60df6a409f9602518fdf861c8","observation_id":"8ba7f66a-6485-4d5e-a4f5-ce4d07460d7d","resolution":{"observed_at":"2026-08-15T14:33:57.124460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.129118Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.129118Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:990360e9f02375ea48f55c9e01eda784163bd800e3a42b89b19f93ac00285ad8","observation_id":"46324ddc-457d-4a94-a6cb-c08b3c1545cd","resolution":{"observed_at":"2026-08-15T14:33:57.129118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.133644Z","title":"and Lowe, Ryan and Voss, Chelsea and Radford, Alec and Amodei, Dario and Christiano, Paul , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.133644Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:116efcddff79bfc57bcbb3c47eef86ce0190e86d9cb011e2ec9cde10b468acd0","observation_id":"274a8131-8ca5-4873-97d8-a5f851c1341c","resolution":{"observed_at":"2026-08-15T14:33:57.133644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.138244Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.138244Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:f7057a21d7f62d3ec23e08dd20e58b91102459ba226dcd5a216b03adec409936","observation_id":"5cd98524-5651-4f5c-b20e-0470ba91a435","resolution":{"observed_at":"2026-08-15T14:33:57.138244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.142652Z","title":"Teaching language models to support answers with verified quotes , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.142652Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:cf41fc363a76f6b78630a136c392ea6fb75b0e179aeb0dae240cc66f3193e7f7","observation_id":"ed0213e2-728b-45f2-9c6f-feb18546326d","resolution":{"observed_at":"2026-08-15T14:33:57.142652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-08-11T23:28:54.309888Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-15T14:33:57.147232Z","title":"Improving alignment of dialogue agents via targeted human judgements , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.147232Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:6df1027073bec049cd0478170868c607c8dad79504e10c130818b2c7befa16bc","observation_id":"447b022d-ebf1-447f-b9d0-67d9c007791d","resolution":{"observed_at":"2026-08-15T14:33:57.147232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.152934Z","title":"Language model cascades , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.152934Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:30f78a23346bd32149c52c08f624c6f7a0e3259a848a0929ea0950afc68e329f","observation_id":"c6750c18-9717-4cd6-9017-2a56ab5ee40f","resolution":{"observed_at":"2026-08-15T14:33:57.152934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.157481Z","title":"ArXiv preprint , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.157481Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:c5a9c815c511e4ce7a2921a31b09e02f7a70af8e11de0f7f46b87a4944167bef","observation_id":"2346ffb3-ea28-4385-98e3-fc4183a5562f","resolution":{"observed_at":"2026-08-15T14:33:57.157481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.162101Z","title":"Mescheder and Andreas Geiger and Sebastian Nowozin , bibsource =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.162101Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:5053a4130e1433280c4db902d9624ddd35acb778705c35382bff97a6db9426f3","observation_id":"a6b5686a-6d7d-441f-b384-af4db57aa04d","resolution":{"observed_at":"2026-08-15T14:33:57.162101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.166653Z","title":"Generative Adversarial Networks , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.166653Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:eff23b6e1eb83d4df55c7b7291cb353232d65ceae6fc459ed8ce0ed77ab4e55e","observation_id":"46a11b83-bb53-4823-a71a-3129f3a874fc","resolution":{"observed_at":"2026-08-15T14:33:57.166653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.171515Z","title":"Mode Regularized Generative Adversarial Networks , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.171515Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:86886f31dbb8f37e9d3e93c1791a9a4790df04c736331ffce42238b1cb37abf5","observation_id":"17ab093b-166c-4c7c-aa84-28534fd699ad","resolution":{"observed_at":"2026-08-15T14:33:57.171515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.176045Z","title":"f-GAN: Training Generative Neural Samplers using Variational Divergence Minimization , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.176045Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:b9c6ee00f372945fda15b0a950541123fe6b3dda5a164f152b0473eb0c5d070c","observation_id":"9ae8c800-8c61-413d-b077-603d2ea29f17","resolution":{"observed_at":"2026-08-15T14:33:57.176045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.180704Z","title":"Wasserstein Generative Adversarial Networks , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.180704Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:ad452168069a7c79cb354c86eff251d7ee2d88861ec60e0b6dc26fbb232c1691","observation_id":"2abc691a-e1cb-468f-9642-7471a6c57d6f","resolution":{"observed_at":"2026-08-15T14:33:57.180704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.185254Z","title":"How (not) to Train your Generative Model: Scheduled Sampling, Likelihood, Adversary? , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.185254Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:cb5439cc2f5c366af69cf930ffac313912483e31df51a96335a75a0ca4d52885","observation_id":"ee9f2732-8899-4638-ad1c-7c7baa33d817","resolution":{"observed_at":"2026-08-15T14:33:57.185254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.189823Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.189823Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:66345c3b8194f16667dcbd9b8f9180cf0ac1c37d46f714faad4340ed16e7c42f","observation_id":"5f5c4e90-65cf-45b6-81e3-d0b0737cc5ed","resolution":{"observed_at":"2026-08-15T14:33:57.189823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.194390Z","title":"Scaling instruction-finetuned language models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.194390Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:47c7bbf831d27d83e7043a211f9a3bc8ae51b954d2538b69056cffb372f22740","observation_id":"0e94129f-2d09-40c1-91d3-ea56dabd76a8","resolution":{"observed_at":"2026-08-15T14:33:57.194390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.198820Z","title":"Self-critiquing models for assisting human evaluators , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.198820Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:853356333ea543666be49b6bb5a96d4a0a741b8f65c4c856bed41997b8a2cd86","observation_id":"03b6dee3-3398-4b43-95a2-2fa4c56abcd5","resolution":{"observed_at":"2026-08-15T14:33:57.198820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.203293Z","title":"Process for Adapting Language Models to Society (PALMS) with Values-Targeted Datasets , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.203293Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:2537d934ca44ea66afbebbfa23975685fc017683430121fe5d13548f94ca518f","observation_id":"38726201-e607-4654-9095-5e6a2b22fac3","resolution":{"observed_at":"2026-08-15T14:33:57.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.207858Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.207858Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:41400501f599d1223b91da7da352f42a47454ef8c02922c5379fb14c62a5227c","observation_id":"0e9db845-e824-4967-8fc2-09e2cf427a21","resolution":{"observed_at":"2026-08-15T14:33:57.207858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.212359Z","title":"Challenges in Detoxifying Language Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.212359Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:a161eed5d42d71772f45e8370662120906d7655f126042c782ef8db787bea8fa","observation_id":"901ed4b7-d47d-4fd5-88e2-1d332da4f728","resolution":{"observed_at":"2026-08-15T14:33:57.212359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.216973Z","title":"ArXiv preprint , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.216973Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:4005c4681aa2280c690f3eb47a97647147a458f51db08cfe850427e2d2c8e215","observation_id":"7938579b-100d-469d-8f68-19d8bfe62f8b","resolution":{"observed_at":"2026-08-15T14:33:57.216973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.221522Z","title":"ArXiv preprint , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.221522Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:cf64c09a4ca50d4a96a6b88343257b624df6b06d8153ac4a40f8ad8df34552ac","observation_id":"fe9522e8-4ed0-4987-bae7-a27481bd400f","resolution":{"observed_at":"2026-08-15T14:33:57.221522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.226150Z","title":"Owen , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.226150Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:209cccacb37fa73a3c2c433a4ff9fe91eaf154b4ea4a6ffdd6516ede8899aa4f","observation_id":"9bfc43a6-2d05-458a-9ad5-40448b103c7e","resolution":{"observed_at":"2026-08-15T14:33:57.226150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:33:57.230753Z","title":"Recipes for Building an Open-Domain Chatbot , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:57.230753Z"},"links":{"citing_paper":"/paper/2608.07419"},"observation_digest":"sha256:86b4f39dbc67c825559e080978d8bc0954bef4dce0c31f4c74c837ba41a48c92","observation_id":"2001f8b8-6601-4cbe-85b0-7c7cbac4970c","resolution":{"observed_at":"2026-08-15T14:33:57.230753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07419","last_updated":"2026-08-07T17:05:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T14:25:00.860253Z","submitted_at":"2026-08-07T17:05:10Z","title":"Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":98,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 0 inbound Pith citation observations for arXiv:2608.07419."}