{"as_of":"2026-08-18T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7b02b508e847bcc15d288738cbd615e3d5fadf6038f3de8af89a943ea92c4a9","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:01:23.023749Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T04:49:15.239636Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T04:52:17.135964Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"cited_work":{"arxiv_id":"2506.18082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18082","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical multicriteria evaluation of llm-generated text","venue":null,"work_id":"b8053304-2de4-4a82-a93c-268a685b7ea8","year":2025},"citing_paper":{"arxiv_id":"2605.12208","last_updated":"2026-05-28T06:21:29Z","snapshot_observed_at":"2026-08-11T16:40:32.163269Z","submitted_at":"2026-05-12T14:46:08Z","title":"Self-Supervised Laplace Approximation for Bayesian Uncertainty Quantification","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T04:49:15.239636Z"},"links":{"cited_paper":"/paper/2506.18082","citing_paper":"/paper/2605.12208"},"observation_digest":"sha256:d899982aa4ff2318da9ebd9ce6173f65f0740aaa4cdf0d728a04ecc65ec44df3","observation_id":"9b8b12fd-8aec-424e-83be-138f89dee1bc","resolution":{"observed_at":"2026-05-13T04:52:17.137374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18082/citation-record","integrity":"/paper/2506.18082/integrity","json":"/paper/2506.18082/citation-record.json","paper":"/paper/2506.18082"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:01:22.612704Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.612704Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:7c5ad5b9ccd7e851c5c0fe84c6f3a12e3943b8b9fed95c0ea19fa214fbbae302","observation_id":"73934b5a-b8bd-4fad-9184-f14341d7d33b","resolution":{"observed_at":"2026-08-15T19:01:22.612704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.618735Z","title":"A learning algorithm for boltzmann machines","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.618735Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:59e1c010539babc399ee141edc76e4f7241246d38f90e48213eb0343dc004c1b","observation_id":"047cc169-9748-4ac8-8dd0-afd73b65e784","resolution":{"observed_at":"2026-08-15T19:01:22.618735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07166","last_updated":"2025-02-11T01:20:32Z","snapshot_observed_at":"2026-08-15T07:01:40.834660Z","submitted_at":"2025-02-11T01:20:32Z","title":"Bayesian Optimization for Building Social-Influence-Free Consensus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07166","snapshot_observed_at":"2026-08-15T19:01:22.623798Z","title":"Bayesian optimization for building social-influence-free consensus","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.623798Z"},"links":{"cited_paper":"/paper/2502.07166","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:5bf71d273bba6c0d69e29c983836e1717130613b6c8e47b7c07c69bff0dadc0c","observation_id":"3d5a76c7-339b-4488-b6d2-3deb50423093","resolution":{"observed_at":"2026-08-15T19:01:22.623798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.629098Z","title":"Jointly measuring diversity and quality in text generation models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.629098Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:d74bd8630a26d8687df4be94143a3111857e35225aecdd18a29d2035bd5c52cb","observation_id":"bd10c74c-bbdc-4b18-9328-500dd98a5989","resolution":{"observed_at":"2026-08-15T19:01:22.629098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15604","last_updated":"2026-08-06T08:45:18Z","snapshot_observed_at":"2026-08-16T21:55:02.035818Z","submitted_at":"2024-05-24T14:38:11Z","title":"Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15604","snapshot_observed_at":"2026-08-15T19:01:22.634347Z","title":"Text generation: A systematic literature review of tasks, evaluation, and challenges, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.634347Z"},"links":{"cited_paper":"/paper/2405.15604","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:3c7a18415285c0bcb49a95e79b04638f9b48602f0936f32879807c4306e4e5dc","observation_id":"6c93fbea-aa3e-477e-b6c0-6075fae97fbc","resolution":{"observed_at":"2026-08-15T19:01:22.634347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.639624Z","title":"Howcroft","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.639624Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:57f8e85adbe79cd8073ec84bab8a5ed5cb5472faf770099ff132ccae819bf346","observation_id":"6ab273dd-3369-4e8b-8c2c-519065bcb098","resolution":{"observed_at":"2026-08-15T19:01:22.639624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.645123Z","title":"Time for a change: a tutorial for comparing multiple classifiers through bayesian analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.645123Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:f04b31276b51c53f384583f1a59fb7bc9c47cccf32cf609596094df942a1c4fb","observation_id":"d80f3a6b-10a5-4745-abef-2f56854447b3","resolution":{"observed_at":"2026-08-15T19:01:22.645123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.649563Z","title":"Estimating the replication probability of significant classification benchmark experiments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.649563Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4dc0b5db350d1cb18fb7ac06a2e7ab8daf976eb1166c8e7dd5187bcc9417ef88","observation_id":"be63f9a0-102e-48ad-ad99-ea2ee7f1b679","resolution":{"observed_at":"2026-08-15T19:01:22.649563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.654122Z","title":"Comparing machine learning algorithms by union-free generic depth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.654122Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:0c056da61633951c2672154c52c179221a6fb9fe77b09edacbae719ddd8d8854","observation_id":"180392b0-bcbb-4614-b21d-5cc702d4a68f","resolution":{"observed_at":"2026-08-15T19:01:22.654122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20917","last_updated":"2024-07-30T15:54:18Z","snapshot_observed_at":"2026-08-16T13:29:49.778098Z","submitted_at":"2024-07-30T15:54:18Z","title":"How to Choose a Reinforcement-Learning Algorithm","version":1},"cited_work":{"arxiv_id":"2407.20917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.20917","snapshot_observed_at":"2026-08-15T19:01:23.493219Z","title":"How to Choose a Reinforcement-Learning Algorithm","venue":"cs.LG","work_id":"740ecb97-f029-432d-b18b-1652aaf5f45b","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.659145Z"},"links":{"cited_paper":"/paper/2407.20917","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:0003703613923d23120aaaa3577f939c5e10b5a29e9df6e7eb5e0a8fd79f80d3","observation_id":"7fd33ca0-421c-428a-b184-435ac2a8c915","resolution":{"observed_at":"2026-08-15T19:01:23.498287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.664456Z","title":"Self-learning from pairwise credal labels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.664456Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:5c4b5f897f5759311dcf85e1cce1c43fdf6332ca576a8440b21129d2016eecb4","observation_id":"2f2a6f9b-d7d4-4e06-85b5-1e658d827352","resolution":{"observed_at":"2026-08-15T19:01:22.664456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09656","last_updated":"2024-10-22T15:36:34Z","snapshot_observed_at":"2026-08-16T15:54:16.884510Z","submitted_at":"2023-02-19T19:03:26Z","title":"Credal Bayesian Deep Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09656","snapshot_observed_at":"2026-08-15T19:01:22.668977Z","title":"Credal bayesian deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.668977Z"},"links":{"cited_paper":"/paper/2302.09656","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:77d62c55746d090c090083e499853a28bcb2cb526a48e21baa2b7368e28a2e17","observation_id":"06115b3f-35d0-41a9-92d9-a41461efc11c","resolution":{"observed_at":"2026-08-15T19:01:22.668977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14799","last_updated":"2021-05-18T07:04:41Z","snapshot_observed_at":"2026-08-13T22:18:30.189974Z","submitted_at":"2020-06-26T04:52:48Z","title":"Evaluation of Text Generation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14799","snapshot_observed_at":"2026-08-15T19:01:22.674048Z","title":"Evaluation of text generation: A survey, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.674048Z"},"links":{"cited_paper":"/paper/2006.14799","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:2f50f23cb41233b2bc8326d52932c9fa9f24d3f5ee28b061ca166089e4e4b9d9","observation_id":"a7374a2e-e032-4ad9-b368-1b027ee2837b","resolution":{"observed_at":"2026-08-15T19:01:22.674048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14614","last_updated":"2024-09-23T10:46:48Z","snapshot_observed_at":"2026-08-16T13:32:36.815875Z","submitted_at":"2024-07-19T18:13:37Z","title":"Evaluating language models as risk scores","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14614","snapshot_observed_at":"2026-08-15T19:01:22.679008Z","title":"Evaluating language models as risk scores","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.679008Z"},"links":{"cited_paper":"/paper/2407.14614","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:900faa130383a346b407e64de3732f31b1df010878f66e05533c4bc237382f21","observation_id":"37a75dca-7e3d-4efb-968e-8ccfe098d594","resolution":{"observed_at":"2026-08-15T19:01:22.679008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.684349Z","title":"Dem s ar","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.684349Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:e4a073636da484669c3efb697b750d794825a6aa38bea9780bb6ac6326607678","observation_id":"de2d369e-ba1e-41c7-83f6-96f86b9678c6","resolution":{"observed_at":"2026-08-15T19:01:22.684349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.365439Z","title":"Semi-supervised learning guided by the generalized bayes rule under soft revision","venue":null,"work_id":"0bdf8af3-7fe3-409c-bfa0-0e47f73550fd","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.688853Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:a8f681fabfd3f8b5db37755d86f32d48442ce5df12234b615736a8293a531e7c","observation_id":"48152cc6-be62-424b-90c2-7df5bd442a12","resolution":{"observed_at":"2026-08-15T19:01:24.370372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.350324Z","title":null,"venue":null,"work_id":"d41182e8-0e4d-48e8-a607-8655e7af54e1","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.693271Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:8af1fa9123e85d49a342bf613a4e505ce8aca9fa73e43ff47d1505cfe90dbf5a","observation_id":"50948c9c-2caf-48cc-89a4-cd79f0608d6f","resolution":{"observed_at":"2026-08-15T19:01:24.355254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.334270Z","title":"Eugster, T","venue":null,"work_id":"0165a5cc-862d-4650-ae96-52435109853c","year":2012},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.699076Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:f1ea7e5bdc894a0ad26d7060b63daa95c10125a2553687dd7fab15d26f06e960","observation_id":"5d176290-587d-4e28-8a29-41249b8a12a9","resolution":{"observed_at":"2026-08-15T19:01:24.340072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.319145Z","title":"Hierarchical neural story generation, 2018","venue":null,"work_id":"1b80e80f-d7df-4937-a961-05683429584f","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.703565Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:6d3f397889916063c2e4825c6878bfced864bd1430de3aed5b04936d61d87494","observation_id":"0b2b8622-edac-4319-8f46-9928f3308b49","resolution":{"observed_at":"2026-08-15T19:01:24.323904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.708202Z","title":"Beam search strategies for neural machine translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.708202Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:70f265f8339b14361951c8da9c53160ec7004d983c36411fd4adae2f6769f3c2","observation_id":"a470a5ca-8b39-47e1-9cfa-ce2230e1f604","resolution":{"observed_at":"2026-08-15T19:01:22.708202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.712984Z","title":"Simcse: Simple contrastive learning of sentence embeddings, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.712984Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:e9d85ac2aced9e494d293dbf0936b70c410221cc78372a3b1a23dd1c94386601","observation_id":"502d7b1d-5c40-4a6f-8b77-93039ee13f03","resolution":{"observed_at":"2026-08-15T19:01:22.712984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18698","last_updated":"2024-10-21T08:43:41Z","snapshot_observed_at":"2026-08-16T13:30:47.810620Z","submitted_at":"2024-07-26T12:23:54Z","title":"Adaptive Contrastive Search: Uncertainty-Guided Decoding for Open-Ended Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18698","snapshot_observed_at":"2026-08-15T19:01:22.717493Z","title":"Adaptive contrastive search: Uncertainty-guided decoding for open-ended text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.717493Z"},"links":{"cited_paper":"/paper/2407.18698","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:0333bce2ca369ecd5f265b2721d3ae94a0ae9daa707ca14787fa3f8942466491","observation_id":"c70d8371-79a8-4660-aed6-08e2de291b8b","resolution":{"observed_at":"2026-08-15T19:01:22.717493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.290776Z","title":"Decoding decoded: Understanding hyperparameter effects in open-ended text generation","venue":null,"work_id":"e525dbf8-259f-4da0-a064-fa35f497bfc4","year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.722044Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:71f0b0d1b5f250b21d2475f5e51877e617a43e8acf5c927d308256162281ac54","observation_id":"809d74bb-aed3-46c0-b02c-1d76cb139846","resolution":{"observed_at":"2026-08-15T19:01:24.295768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18653","last_updated":"2025-06-17T17:41:07Z","snapshot_observed_at":"2026-08-18T04:57:16.898679Z","submitted_at":"2024-10-24T11:32:01Z","title":"Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework","version":3},"cited_work":{"arxiv_id":"2410.18653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18653","snapshot_observed_at":"2026-08-15T19:01:23.401358Z","title":"Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework","venue":"cs.CL","work_id":"cab31625-7777-4d8c-9ebf-ab5c8f12e7c8","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.726512Z"},"links":{"cited_paper":"/paper/2410.18653","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:01522e97df8c0d1d9b8ed5341a98214d37a9dc8e3e7dec9174b2a21b782c918d","observation_id":"41b2dbed-66f3-4aca-8dca-3aeb8f0d9da1","resolution":{"observed_at":"2026-08-15T19:01:23.406919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.275589Z","title":"Garc \\'i a and F","venue":null,"work_id":"6ac01ea8-cd7b-4933-bdb6-d599f88e919a","year":2008},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.731330Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:ffb4f7fe62b2d24d18ec1434a644794611b44e81edd708133eb64d353c404dcd","observation_id":"47b56d44-0696-4371-ae7c-de8d090e9441","resolution":{"observed_at":"2026-08-15T19:01:24.280452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.261281Z","title":"García, A","venue":null,"work_id":"80887220-c2bf-429b-938f-978ddc5544bc","year":2010},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.736083Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:44570ca3ff07461e660d7d4be8a071dc3570434a4ce91743ac1129b465e7d672","observation_id":"98af811d-5f3d-42e5-8310-aefcfe993338","resolution":{"observed_at":"2026-08-15T19:01:24.266075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T19:01:22.740637Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.740637Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:1729ff5a7a24c1de1918593c0c59ec2862343aa0d106ac0ba6c1adda8c0864c4","observation_id":"847f3e74-df78-4e72-835d-c74db774bf9d","resolution":{"observed_at":"2026-08-15T19:01:22.740637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:01:22.745434Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.745434Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:5ae87af8e12329f51afec3ddeaeda167993203d71ae452c9eba1d9b682b4c6c7","observation_id":"62970aa5-b0fd-448e-87e5-f8fdbb56fd96","resolution":{"observed_at":"2026-08-15T19:01:22.745434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02792","last_updated":"2019-04-04T21:03:34Z","snapshot_observed_at":"2026-08-16T03:04:17.238046Z","submitted_at":"2019-04-04T21:03:34Z","title":"Unifying Human and Statistical Evaluation for Natural Language Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02792","snapshot_observed_at":"2026-08-15T19:01:22.749990Z","title":"Hashimoto, Hugh Zhang, and Percy Liang","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.749990Z"},"links":{"cited_paper":"/paper/1904.02792","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:dc5fdb9ba8f791cc808a9270b80dc08507ebb8ff7ae08f6ab1173552042d5a83","observation_id":"f06a955f-23d7-49ff-9010-f1e8e2bd8cf0","resolution":{"observed_at":"2026-08-15T19:01:22.749990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-15T19:01:22.755057Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.755057Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:e384a06fc7933ff472e6a1f8452a822871bc14538f6be8ce2df29eb29574298c","observation_id":"d9a87aa2-064c-415d-845c-7fab3f7e4763","resolution":{"observed_at":"2026-08-15T19:01:22.755057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.246031Z","title":"Hothorn, F","venue":null,"work_id":"de64451a-8ae0-4ab0-b875-ecc0d06cdb0d","year":2005},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.760019Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:c2dee847138df9d9dcfb8d814f507a090b47e84783648a9560d771aec1708b2c","observation_id":"3eb4cdf9-2109-46e9-8d61-42e0b965f71d","resolution":{"observed_at":"2026-08-15T19:01:24.250826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.764669Z","title":"Open graph benchmark: Datasets for machine learning on graphs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.764669Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:40dd4f47c330818b0ccf1fc74b07cd519139da649b1f2f4d7932db39673ca473","observation_id":"482aa6f5-0bbe-4eb1-950c-6434c19dd408","resolution":{"observed_at":"2026-08-15T19:01:22.764669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.220331Z","title":null,"venue":null,"work_id":"6cedbae0-0b19-4883-8e8d-dabb59ffd9e8","year":1981},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.768921Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:79b3d0a2a6006933f7f668be044c279e5a711d167e76df0f18c167e850f2e2e4","observation_id":"d4c2c78a-1f2f-4702-83eb-305930651da5","resolution":{"observed_at":"2026-08-15T19:01:24.225154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.203710Z","title":"Jansen, G","venue":null,"work_id":"c2436a80-3219-4393-9df7-f2af764e21ca","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.773521Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:7d5645947656d039654e91599259a3f785375a9fcffd1aee95f69dd88aeb3a57","observation_id":"d6245343-16f7-468b-be3d-58c25aa7a060","resolution":{"observed_at":"2026-08-15T19:01:24.208171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.186644Z","title":"Jansen, H","venue":null,"work_id":"3155e4f9-d80f-4953-92bf-d2cb7c2fba51","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.777980Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:0644cf26fdc7580df691f67eb3bb8178b5c4c405d7ffa1fb0f0d4b2db0e3a461","observation_id":"7f5a2312-0e66-4ddb-a436-6c2159c36e4e","resolution":{"observed_at":"2026-08-15T19:01:24.191725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10195","last_updated":"2025-01-17T13:39:51Z","snapshot_observed_at":"2026-08-16T12:58:49.433589Z","submitted_at":"2025-01-17T13:39:51Z","title":"Contributions to the Decision Theoretic Foundations of Machine Learning and Robust Statistics under Weakly Structured Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10195","snapshot_observed_at":"2026-08-15T19:01:22.782509Z","title":"Contributions to the decision theoretic foundations of machine learning and robust statistics under weakly structured information, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.782509Z"},"links":{"cited_paper":"/paper/2501.10195","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:e979ce71847239dc8fed1d073f7ed920da964e683cd4ac04b9752274d63ce77d","observation_id":"abde3ebb-d0fc-4b16-872b-7c4b2e5a2439","resolution":{"observed_at":"2026-08-15T19:01:22.782509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.169993Z","title":"Statistical comparisons of classifiers by generalized stochastic dominance","venue":null,"work_id":"5032e47b-7bdf-4bde-83fb-931f47d6889c","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.787435Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:23c7763ff198a6aa34ac22915b5c7fdc7769aaf20e91b7dc72c86c4e7bff3b8c","observation_id":"0d9394e2-1fc2-49d7-a269-ea2bb814f8ad","resolution":{"observed_at":"2026-08-15T19:01:24.175823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.154026Z","title":"Multi-target decision making under conditions of severe uncertainty","venue":null,"work_id":"4b30e8ec-07d3-4851-bcf9-4974490f5cd3","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.792086Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:95f12a3c47c722f41d5cbbb356e57cd2fb484346d6bb6c0df57bd6471d5bddfe","observation_id":"ee6a52ff-a88f-4ff5-9a52-0ef5ac3231dc","resolution":{"observed_at":"2026-08-15T19:01:24.158971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.138623Z","title":"Robust statistical comparison of random variables with locally varying scale of measurement","venue":null,"work_id":"fc0dad15-681a-404d-b78d-37c5ca3293f8","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.796599Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:5191e2239908a17a7b8a622664b9f4e8c5a4118bba13d4acc92da502122ee821","observation_id":"9478c78a-6f67-461b-8abc-620cc3c3064c","resolution":{"observed_at":"2026-08-15T19:01:24.143662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.121687Z","title":"Statistical multicriteria benchmarking via the GSD -front","venue":null,"work_id":"8c39d409-ca80-464c-8bc7-009884474404","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.801334Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:504a49d44490eee2f48b78767bdd8fa2e8429f5190804170cfb468966959933e","observation_id":"2e7b3895-f8a9-44d8-9276-bcecca37765b","resolution":{"observed_at":"2026-08-15T19:01:24.126866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.805751Z","title":"Jelinek, R","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.805751Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:d90fe1825247d44ddd4270df6e8efb36fdae4a54591f416f3577dcb19e852848","observation_id":"47d7e42a-b273-4d21-9b91-4c51e05154ad","resolution":{"observed_at":"2026-08-15T19:01:22.805751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.100342Z","title":"The prism alignment dataset: What participatory, representative and individualised human feedback reveals about the subjective and multicultural alignment of large language models","venue":null,"work_id":"8f7e129e-252d-4184-adf0-1c61fdd99504","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.810810Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:9430b2ef2937896478df99264a0ea71b6d5530f319c3c4bcab9a1f8be84dfb9c","observation_id":"405d4636-93bb-47fd-989a-03089d3a33a9","resolution":{"observed_at":"2026-08-15T19:01:24.106718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.079371Z","title":"Efficient multi-criteria optimization on noisy machine learning problems","venue":null,"work_id":"219be6f1-29c2-4dc2-aa4e-c4175d8eaeed","year":2015},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.815635Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4e7d3681596b625f8fbe88c228413dd89910cb87f15f53103fa292612aa573e8","observation_id":"552b9996-ea13-499c-9877-1c36bc3abfd1","resolution":{"observed_at":"2026-08-15T19:01:24.084317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.063147Z","title":"Towards quantifying the effect of datasets for benchmarking: A look at tabular machine learning","venue":null,"work_id":"9a8d12b9-c182-4f4c-968b-cb710a8f711a","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.820250Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:8f3526d478a0b4058590252677cc4a7cccc0c0b82bf6c07920cb929e65cd13e5","observation_id":"ad91afc2-cd04-4249-8be3-23b5cd9e65f1","resolution":{"observed_at":"2026-08-15T19:01:24.068837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.046230Z","title":"Accelerated experimental design using a human-ai teaming framework","venue":null,"work_id":"25a4577d-2cf1-49e5-940d-ac8877ab2463","year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.825117Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:ed6a2d1bbfa78a340e88742b3d8033217b11bced7975c4424f2c7ab2667af246","observation_id":"7e220059-a974-498a-bdc9-bd69afd6e9f9","resolution":{"observed_at":"2026-08-15T19:01:24.051460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.024759Z","title":"Factuality enhanced language models for open-ended text generation","venue":null,"work_id":"c1d30598-16ce-44d0-98c7-bd70c02bcf91","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.829565Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:2ca19f715105ab6a2ec0a7273abba3da06eb1011ddeda150b03192a258f87e5b","observation_id":"8363a457-cb5f-41f4-8e89-a1f6dc33daab","resolution":{"observed_at":"2026-08-15T19:01:24.030793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.004040Z","title":"A diversity-promoting objective function for neural conversation models","venue":null,"work_id":"88d6d15b-e612-48cc-8a09-d7d9f36fce30","year":2016},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.834159Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:134519ecaa48d7082e2b163d838f65bd1ad0c1af0f89e3352cc09eb342ca2bcc","observation_id":"94544a59-e947-480a-8e71-1e8d656d5c9e","resolution":{"observed_at":"2026-08-15T19:01:24.010099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.839032Z","title":"Contrastive decoding: Open-ended text generation as optimization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.839032Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:0fbe61ce52e38f47c6a5a57e748844d3918f6d88a5254622e26ef6e561adc772","observation_id":"57e6a772-cc2b-407d-b354-7fa7a9464712","resolution":{"observed_at":"2026-08-15T19:01:22.839032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-16T13:42:51.314941Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-15T19:01:22.843911Z","title":"Quantifying variance in evaluation benchmarks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.843911Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:268de2b3e4bdd3e8fce4057656618cc8369e5a960fe4067e2a18bd7e1b667b81","observation_id":"875b34cc-8ac6-4733-9fe6-ab580adcc110","resolution":{"observed_at":"2026-08-15T19:01:22.843911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.849573Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.849573Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:9b9ac3291d81dffc4934f7b7dd0e87ee31e75683e10b8de777c3b245ee9ece98","observation_id":"8993ba60-1552-4443-8894-7bb642e477e4","resolution":{"observed_at":"2026-08-15T19:01:22.849573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.962673Z","title":"Mersmann, M","venue":null,"work_id":"399180f1-2cf5-4b67-9806-a07b3a656201","year":2015},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.854610Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:6303c643a14d481a4940bbde253b2c2ef97b3986ac069c5f4d26e35f1644401e","observation_id":"cecee8ff-15b0-4016-a5c2-1b9d7fb8f91e","resolution":{"observed_at":"2026-08-15T19:01:23.967599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.948459Z","title":"Meyer, F","venue":null,"work_id":"6225f23b-fe21-43ac-a893-f3e078dab02a","year":2003},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.859368Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:5153661c638a6703a0a8c27736e36fb1f6f07e2df74425ac9669eb83e1377145","observation_id":"f3b8f4af-bcea-4658-8d44-d31cd6c37a8b","resolution":{"observed_at":"2026-08-15T19:01:23.953009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.932867Z","title":"Learning de-biased regression trees and forests from complex samples","venue":null,"work_id":"cf0444da-2cd8-476a-9c14-b7b02e1953fe","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.863706Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:45e77f69c57fe694a7559498c3b474de57c0ec8795e88471728c85f15af5ab18","observation_id":"006789af-20db-4f85-9519-c68d78d8394c","resolution":{"observed_at":"2026-08-15T19:01:23.937613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.916319Z","title":null,"venue":null,"work_id":"c90bffcd-6941-4ac1-950a-fe4dbaa0ad83","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.868285Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:efddba7ee5edd1cacac6dd7aa9a75a53f9242b804a360044ec8ba3d23216f8da","observation_id":"d32f776c-4f0f-494a-b456-b7912e58b482","resolution":{"observed_at":"2026-08-15T19:01:23.921306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.900188Z","title":"Mauve: Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":"196f5dd1-18e5-402e-b119-a6a260ca7804","year":2021},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.872613Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:75a50158cc3f5642ba6c2a70c7c45de92a94305b26256864217036546f8ea82f","observation_id":"5fd61fd8-57aa-4927-b217-4cdf03e943ec","resolution":{"observed_at":"2026-08-15T19:01:23.905053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.876746Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.876746Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:d3e4193f070716604421657a21fd5d8513efce3bc05cda9046d5acc8b6c5b749","observation_id":"30056779-8cec-45f2-b62c-1190e981c105","resolution":{"observed_at":"2026-08-15T19:01:22.876746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.873991Z","title":"Partial rankings of optimizers","venue":null,"work_id":"c57e368b-b4bd-4e87-b1b7-63c3c9416641","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.881040Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:fe540898571428f2ca51776cdc6678484233d1ca829369fdf728db916ffcb86c","observation_id":"dd83a02d-229d-417e-a2c9-46d02366bcf8","resolution":{"observed_at":"2026-08-15T19:01:23.879394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.857387Z","title":"Levelwise data disambiguation by cautious superset classification","venue":null,"work_id":"712f6f9d-6504-411f-ac41-ed27bf809a75","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.885608Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:ba2d6d91a24045f26f72c9379f0a5599a32c02c56b75768c6863f8870e4cd505","observation_id":"c5a11e91-667c-4885-b3d2-382221ab37b1","resolution":{"observed_at":"2026-08-15T19:01:23.862698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.841805Z","title":"Approximately bayes-optimal pseudo-label selection","venue":null,"work_id":"82db6367-648c-4427-ba86-8f583fbd7fdb","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.890326Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:8461ca32c23bda1149dd24dbf8439f2760a58d2c1bfe56b8b891b9d9de094ccb","observation_id":"e07be0ab-dc50-4d13-9a55-4209ff7d99e0","resolution":{"observed_at":"2026-08-15T19:01:23.846974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.825946Z","title":"In all likelihoods: Robust selection of pseudo-labeled data","venue":null,"work_id":"42ab9b58-4506-462a-81c7-e16452936994","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.894647Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:144862ee58fcdbd910011c6208e7ecf0da1d2ba9ff779fe110349496f5c05f7a","observation_id":"75b9fd2e-c80a-47e0-abcb-a0e83b233fd3","resolution":{"observed_at":"2026-08-15T19:01:23.830638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04629","last_updated":"2024-03-08T07:52:32Z","snapshot_observed_at":"2026-08-16T14:11:54.460218Z","submitted_at":"2024-03-07T16:13:32Z","title":"Explaining Bayesian Optimization by Shapley Values Facilitates Human-AI Collaboration","version":2},"cited_work":{"arxiv_id":"2403.04629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04629","snapshot_observed_at":"2026-08-15T19:01:23.275656Z","title":"Explaining Bayesian Optimization by Shapley Values Facilitates Human-AI Collaboration","venue":"cs.LG","work_id":"191dd38c-fcd1-4ec7-a4ef-1548e020a854","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.899482Z"},"links":{"cited_paper":"/paper/2403.04629","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:25831a34be5d2e0be818c8b7bde28c25ce8a1c60db18e43ee058f07517daf95d","observation_id":"5b254428-beea-4c10-9932-a0170c11af7b","resolution":{"observed_at":"2026-08-15T19:01:23.280879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14581","last_updated":"2025-05-12T09:51:39Z","snapshot_observed_at":"2026-08-18T04:58:47.396246Z","submitted_at":"2025-02-20T14:12:18Z","title":"A Statistical Case Against Empirical Human-AI Alignment","version":2},"cited_work":{"arxiv_id":"2502.14581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14581","snapshot_observed_at":"2026-08-15T19:01:23.251631Z","title":"A Statistical Case Against Empirical Human-AI Alignment","venue":"cs.AI","work_id":"ecb3cbbc-7ae6-4d17-867b-438db7205e57","year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.904326Z"},"links":{"cited_paper":"/paper/2502.14581","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:95b970826a39cdb4c3b4dd6c343834d7db7960de25034a7e31d43ac1f9810b69","observation_id":"7053843b-859e-4f0e-bdc4-214a69dae1a9","resolution":{"observed_at":"2026-08-15T19:01:23.257694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.811267Z","title":"A meta-analysis of overfitting in machine learning","venue":null,"work_id":"0dc52f4f-6a90-4a5c-92ca-81b07ebe9e39","year":2019},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.909152Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4fef289741dd9dce024797fdf56d58d08c525d9b6dcd300920e6cd1e042aa9a2","observation_id":"e1478825-dbcd-4ec9-86c8-772f9d969d6d","resolution":{"observed_at":"2026-08-15T19:01:23.815993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.794611Z","title":"Schneider, L","venue":null,"work_id":"3a07c2fb-2fa0-42e0-8e74-427dd67d5c76","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.913529Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:52d496ab115cdf7eac7d4f629944b01cb0661d1ade4f28e89119c6d1f7b60e02","observation_id":"8c2823b6-54a7-4337-b4fc-06440b25f108","resolution":{"observed_at":"2026-08-15T19:01:23.800614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.776524Z","title":"A minimax learning approach to off-policy evaluation in confounded partially observable markov decision processes","venue":null,"work_id":"12e99164-c288-4154-bee2-26da16de92aa","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.918228Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:115974185a5ef2672a0e2a2cc03d1d978d2b665e88a36aa69e1c3d70cf969ee4","observation_id":"96a68390-0e70-4846-8512-f23487770614","resolution":{"observed_at":"2026-08-15T19:01:23.781777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.758669Z","title":"Shirali, R","venue":null,"work_id":"a0bd47e0-2be4-4936-b04e-8ded889bb487","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.922919Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:10d62d7e219a6aa8a79525c408062354f6d172388b39cbbeadf4cfe05f2e146e","observation_id":"c232a105-626a-44e4-a2d6-a8d84a0dc1c4","resolution":{"observed_at":"2026-08-15T19:01:23.764739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.741915Z","title":"An empirical study on contrastive search and contrastive decoding for open-ended text generation, 2022","venue":null,"work_id":"b93fd79e-4984-4308-9dab-5ea2723531d6","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.927214Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:6aa0bef64b30aca208f68a4ea87a66fbfb3937fe1ffe327e8c2a7d5633cea41b","observation_id":"e0938fbb-fa31-4e29-95c0-98b183dd0140","resolution":{"observed_at":"2026-08-15T19:01:23.746915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.724572Z","title":"A contrastive framework for neural text generation, 2022","venue":null,"work_id":"2d145a4d-5e00-4db3-a937-12b31121c071","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.931636Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:445bc365550a0c694883c4b2e4a9ffd6329c26a8c2e5624939b67b57db40b216","observation_id":"8aa759bd-0119-472c-9ecb-b54d50bca22e","resolution":{"observed_at":"2026-08-15T19:01:23.730152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.708086Z","title":"Evaluating the evaluation of diversity in natural language generation","venue":null,"work_id":"03f49f6f-be35-4322-ad11-1e039ca64d96","year":2021},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.935910Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:cc6cd04f113387652789bf7a21cd8bed4bdec2d13a31414be48d448b544f9731","observation_id":"8d2b3088-51e4-4876-91a8-b01909cd9031","resolution":{"observed_at":"2026-08-15T19:01:23.713796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.691519Z","title":"Scientific machine learning benchmarks","venue":null,"work_id":"6378433f-5e76-4050-938a-21e91a5290d5","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.940493Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:67b7895f336626fab36be4455570b1c9adaaeeed55069452a4537f2c5a5f2948","observation_id":"3f3b1e7d-5e75-4367-bc58-f7eac5178bc6","resolution":{"observed_at":"2026-08-15T19:01:23.696300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.944941Z","title":"Openml: networked science in machine learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.944941Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:65912b83efbd4879a4c1a24b033758e9c8f4729e4dafce3efbbeca014c7cc64b","observation_id":"25df4b8e-684c-49ce-ae01-76e76555ceab","resolution":{"observed_at":"2026-08-15T19:01:22.944941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.949512Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.949512Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:8f8f4e59ad0a87bdf404e714f252d98434612a03a5bf4c748bde04121dffc556","observation_id":"688c6c05-f339-4aca-aea3-74751283f638","resolution":{"observed_at":"2026-08-15T19:01:22.949512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-15T19:01:22.954002Z","title":"Livebench: A challenging, contamination-free llm benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.954002Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:75e9289263fab1728a8d7eb964b1630d1fadf651343ddcc2e5def07f9f480c8b","observation_id":"69419229-b8ae-4126-ae63-cd1742e20623","resolution":{"observed_at":"2026-08-15T19:01:22.954002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10452","last_updated":"2024-10-14T12:46:02Z","snapshot_observed_at":"2026-08-16T13:09:38.569470Z","submitted_at":"2024-10-14T12:46:02Z","title":"Principled Bayesian Optimisation in Collaboration with Human Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10452","snapshot_observed_at":"2026-08-15T19:01:22.958957Z","title":"Principled bayesian optimisation in collaboration with human experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.958957Z"},"links":{"cited_paper":"/paper/2410.10452","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:57d0bf5f63d72d6c2c4cd1de362a29a7324b3f8cc414b2bc648b4d3fda5b4099","observation_id":"79b025d7-184c-4c3c-8d74-3b23bac0e1bd","resolution":{"observed_at":"2026-08-15T19:01:22.958957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T19:01:22.964167Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.964167Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:8e32e334d62e9c17ed784977f40e4050622df2ff0d539d50a3958d428550f896","observation_id":"02fad94f-8661-4f1e-a412-cf73f8c6bb4f","resolution":{"observed_at":"2026-08-15T19:01:22.964167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.652168Z","title":"Benchmarking llms via uncertainty quantification","venue":null,"work_id":"a5ff39ac-545f-4fab-b621-689d3fae2583","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.969120Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:6098e917b98787163ec31a515e1225e20e04576fe3c3c674216e612565a7046a","observation_id":"9dd85e22-0986-42fd-9dd0-adf64cea4b89","resolution":{"observed_at":"2026-08-15T19:01:23.657388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.636795Z","title":"Zhang and M","venue":null,"work_id":"f77eba13-806c-429e-88f2-5f8a5ef69e67","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.973816Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:3302e7a6474f101fc66cf07e3841c62add62753fb29b37bf9008ea5b95c3c29e","observation_id":"80df0dbc-876b-48e6-b825-c1c79dbccd9c","resolution":{"observed_at":"2026-08-15T19:01:23.641910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.620690Z","title":"Inherent trade-offs between diversity and stability in multi-task benchmarks","venue":null,"work_id":"513fde82-ade1-4ad6-9956-46435b06bbe4","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.978485Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:b8139e48246af3ea98e411ea0b4e74737417bc745078d5f559efd775ffbbc1b8","observation_id":"dee8534b-81d3-4281-b9c6-c88936471016","resolution":{"observed_at":"2026-08-15T19:01:23.626263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.601632Z","title":"Zhang, M","venue":null,"work_id":"0ec1d6f5-b151-49f3-834a-ff7214c5b60f","year":2020},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.982795Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:dbee245d0173e797ccee50600052c474ec0c78495720cbcf2111a97c853d9cc7","observation_id":"dcc7d216-632a-4d04-98b1-03c0e069dab1","resolution":{"observed_at":"2026-08-15T19:01:23.607704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-15T19:01:22.987507Z","title":"Opt: Open pre-trained transformer language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.987507Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:1507dd58a2b3eaa0998c983d75a8b6557ec7e6ff29d8124b9626158c23194cf3","observation_id":"bbbe07c5-3379-493f-b2b2-4478d742f342","resolution":{"observed_at":"2026-08-15T19:01:22.987507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-16T14:46:11.658740Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-15T19:01:22.992886Z","title":"Don't make your llm an evaluation benchmark cheater","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.992886Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:dfcad7d1b53b682abad591c84742ad2099d3e88f8a9fa1ab280350b59a034a95","observation_id":"ce165ab0-9b6b-4fd7-b5c3-b509f1e98262","resolution":{"observed_at":"2026-08-15T19:01:22.992886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01632","last_updated":"2025-02-22T20:08:38Z","snapshot_observed_at":"2026-08-16T14:22:01.991920Z","submitted_at":"2024-02-02T18:52:16Z","title":"Time-Varying Gaussian Process Bandits with Unknown Prior","version":4},"cited_work":{"arxiv_id":"2402.01632","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01632","snapshot_observed_at":"2026-08-15T19:01:23.119457Z","title":"Time-Varying Gaussian Process Bandits with Unknown Prior","venue":"cs.LG","work_id":"b5f4cf31-a2fe-4da2-970f-b12712732685","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.998385Z"},"links":{"cited_paper":"/paper/2402.01632","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:13af9dab8304066b9a0a093d3393656e4f9f8d7b90e3b83435edb24d220cfab4","observation_id":"84ec1c5f-a10f-4a70-aa16-4e7972dd720e","resolution":{"observed_at":"2026-08-15T19:01:23.127948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.004618Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.004618Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:afb3d7d9b6caa440b7d4ea3a0627aca51c875c5bfeb0a51b405c769589cced52","observation_id":"f055e5b2-a437-4db0-beb4-bd59ff17b15d","resolution":{"observed_at":"2026-08-15T19:01:23.004618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.010839Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.010839Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:02fe8de0ce6712891518ee48311d888fe41ac0fe641994d09cb9793e8238a9b6","observation_id":"937452c5-e766-4b61-a551-55a656f248d4","resolution":{"observed_at":"2026-08-15T19:01:23.010839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.017499Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.017499Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:92e8ee8d76ed20dfd2bab16cc9122b4929aaa61178a7da04aa15088423681e6a","observation_id":"85b98448-6d2f-48b0-85f8-7259e64911d8","resolution":{"observed_at":"2026-08-15T19:01:23.017499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.023749Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.023749Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:8f2e2723aaee562902e55e1b78092d7614ab8d88c721db8f4fc97d803c4b73ce","observation_id":"07c14cbb-1a00-47ed-a09a-6fc1bb80fc65","resolution":{"observed_at":"2026-08-15T19:01:23.023749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T22:21:12.792699Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":5,"verified_fuzzy":39},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2506.18082."}