{"as_of":"2026-08-16T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66f4bb8f77f9b4d31836551eba03bc1611ef8bbf3a666ae9e39f3bf1092c4d30","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:21:26.126300Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18413/citation-record","integrity":"/paper/2504.18413/integrity","json":"/paper/2504.18413/citation-record.json","paper":"/paper/2504.18413"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.12767","last_updated":"2024-08-22T14:19:06Z","snapshot_observed_at":"2026-08-16T15:46:09.830760Z","submitted_at":"2023-03-22T17:32:56Z","title":"Can we trust the evaluation on ChatGPT?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12767","snapshot_observed_at":"2026-08-16T10:21:25.883260Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.883260Z"},"links":{"cited_paper":"/paper/2303.12767","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:c6c73d6f1baec38386b1c1e47405bd1decdab6ee7ffc93f2cb44f1321974bb94","observation_id":"58b8a280-9297-446e-a097-2d386f68af59","resolution":{"observed_at":"2026-08-16T10:21:25.883260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:27.121009Z","title":null,"venue":null,"work_id":"617cb524-2318-4326-bac3-ede424477806","year":null},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.888983Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:29cc9f9d55ca78c6abcdaace5f06522742ffa99468d1955e4b024aa114fb245e","observation_id":"97a8bd43-5ede-4d9c-b116-a90c1d2ce30f","resolution":{"observed_at":"2026-08-16T10:21:27.125266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:25.898236Z","title":"Bruce Croft, and Mark Sanderson","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.898236Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:6a486a0fedb21313b2e7d5ff81724107d63a063541788664676d32c0a6a96ded","observation_id":"f0ae7b8f-427a-48e3-ba4c-eea5b9fb9c1f","resolution":{"observed_at":"2026-08-16T10:21:25.898236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:25.903209Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.903209Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:f9ca2839af2c0463b6c6b14ad16ff2c31295e16c31016ba4159647a4d80d6e0a","observation_id":"63da9470-c3e5-4314-bb46-260aa2133211","resolution":{"observed_at":"2026-08-16T10:21:25.903209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00723","last_updated":"2023-09-18T03:52:18Z","snapshot_observed_at":"2026-08-16T15:43:20.298261Z","submitted_at":"2023-04-03T05:29:58Z","title":"Exploring the Use of Large Language Models for Reference-Free Text Quality Evaluation: An Empirical Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00723","snapshot_observed_at":"2026-08-16T10:21:25.911997Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.911997Z"},"links":{"cited_paper":"/paper/2304.00723","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:ee1cdaa56400ce845c91edddb66d38b6c7e6af3f1c0726a0c696fd1fbcb6f6a8","observation_id":"970a9468-29f8-4830-818e-cfc359ebefe7","resolution":{"observed_at":"2026-08-16T10:21:25.911997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-16T10:21:25.907544Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.907544Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:aac552d9ce4ba4a179c813b95c1a69480f3d62553d8e22f62dfb817fbd742932","observation_id":"d9cf9ec3-2a24-4fbd-b013-697198005c01","resolution":{"observed_at":"2026-08-16T10:21:25.907544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05657","last_updated":"2023-10-09T12:12:55Z","snapshot_observed_at":"2026-08-16T18:32:37.657518Z","submitted_at":"2023-10-09T12:12:55Z","title":"A Closer Look into Automatic Evaluation Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05657","snapshot_observed_at":"2026-08-16T10:21:25.922444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.922444Z"},"links":{"cited_paper":"/paper/2310.05657","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:a074186c6cb95ca6cc8ca229ce376ac14e24873f4b9774ba0ac195c0d40daeec","observation_id":"47647def-fcef-4404-9f48-38fca9d1d730","resolution":{"observed_at":"2026-08-16T10:21:25.922444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-16T20:55:34.075464Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-16T10:21:25.917092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.917092Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:eb1396a5a03f9f33fc2d8360de879ff0e57f37bca6074cbe9453681bc76960b8","observation_id":"e8da3c36-ba94-4cdb-a8e2-f25f18e0f5db","resolution":{"observed_at":"2026-08-16T10:21:25.917092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-13T16:22:14.977210Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-16T10:21:25.932874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.932874Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:a202c51db0115b66e876d37b61831b831e217a44fcfc6599d652a2841905cd3b","observation_id":"b3a24183-b2d9-4a6a-830a-25da1f545b31","resolution":{"observed_at":"2026-08-16T10:21:25.932874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05204","last_updated":"2020-08-18T17:31:44Z","snapshot_observed_at":"2026-08-15T23:57:51.388417Z","submitted_at":"2019-08-14T16:24:56Z","title":"On The Evaluation of Machine Translation Systems Trained With Back-Translation","version":2},"cited_work":{"arxiv_id":"1908.05204","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.05204","snapshot_observed_at":"2026-08-16T10:21:26.302315Z","title":"On The Evaluation of Machine Translation Systems Trained With Back-Translation","venue":"cs.CL","work_id":"b71aecc4-cf3d-4836-9722-a7eeebd01d4f","year":2019},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.927966Z"},"links":{"cited_paper":"/paper/1908.05204","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:1150c1c36546cdd18ced086de1cea3fbfb20ab3db56c3adc7c122106c154b146","observation_id":"f21e1034-5f70-42bb-b0e9-c9226d7424db","resolution":{"observed_at":"2026-08-16T10:21:26.309260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.04969","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.782928Z","title":null,"venue":null,"work_id":"adb1bafb-89f6-45b2-bc32-5db48149b2d7","year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.941380Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:eda9ac01e0e3bdaa789a40cbbb667820044ebdaa957e64605fa6f4d77d3a0714","observation_id":"ceb0ed0c-80db-4da4-8097-dad59deb5be9","resolution":{"observed_at":"2026-08-16T10:21:26.790440Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:27.096056Z","title":null,"venue":null,"work_id":"aced66c5-f983-4cae-ba25-6ba0ad0ce16a","year":2019},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.937193Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:24ea7771834ec2b32aad0fdb4a4b4a982aa54b7c035e70de6bda2a01ffdddf75","observation_id":"ee6ea400-a4ec-4edd-9333-3864238fc704","resolution":{"observed_at":"2026-08-16T10:21:27.100410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:25.949688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.949688Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:94535a669e44e3e1bad4f6b7d7a876622c85dfe7c405fa5347d3f26941d39d86","observation_id":"6460a8a6-db23-4f55-9c46-50894b02ccc3","resolution":{"observed_at":"2026-08-16T10:21:25.949688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-16T10:21:25.945443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.945443Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:e131408786fc9615b84f253aa58d98c16e00a5988861be21114adc0d11d7e499","observation_id":"e3300c13-4dac-47fb-98d9-aa212b83fe8f","resolution":{"observed_at":"2026-08-16T10:21:25.945443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-16T10:21:25.963232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.963232Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:e7fac0788b770cd8c0da04cf905ce2fea5451d0ce0df701b2e881eccb4b767b5","observation_id":"efde0744-6a09-40d8-bd32-26341c908e18","resolution":{"observed_at":"2026-08-16T10:21:25.963232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:27.071356Z","title":null,"venue":null,"work_id":"61dd10f0-c359-4fd0-81f2-d26bfdcc018c","year":null},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.968096Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:26e35204b9d0096562eebd698e9b0f5e51a26731fd5aa1736876304700211d6c","observation_id":"74114987-1bfc-4a8f-8686-0661a60d711f","resolution":{"observed_at":"2026-08-16T10:21:27.075614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.09833","last_updated":"2019-06-24T10:14:42Z","snapshot_observed_at":"2026-08-13T14:32:31.604904Z","submitted_at":"2019-06-24T10:14:42Z","title":"Translationese in Machine Translation Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.09833","snapshot_observed_at":"2026-08-16T10:21:25.958494Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.958494Z"},"links":{"cited_paper":"/paper/1906.09833","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:720d6252a9c496e995232409dbc2cd0793c05c2b8d1b6874e2cb971094d7088c","observation_id":"29a718aa-c2b7-4a10-9410-1119160c8518","resolution":{"observed_at":"2026-08-16T10:21:25.958494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T10:21:25.981933Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.981933Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:bf2c5c78b4eb63d3d7e9ebd6caab117df83359d3d2ee74bf0f3fe86fea8e4f3c","observation_id":"239da420-edc5-4774-92be-a70179a5704e","resolution":{"observed_at":"2026-08-16T10:21:25.981933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15166","last_updated":"2024-04-04T01:53:38Z","snapshot_observed_at":"2026-08-16T14:32:02.086001Z","submitted_at":"2023-12-23T05:11:37Z","title":"SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15166","snapshot_observed_at":"2026-08-16T10:21:25.986805Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.986805Z"},"links":{"cited_paper":"/paper/2312.15166","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:4cf01d1e31e98da3560be4cac3297615e63c2419883a0e3a33ee7d3d58f77fc6","observation_id":"82c9c9e2-c124-4501-9848-8f46cf12dc8e","resolution":{"observed_at":"2026-08-16T10:21:25.986805Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:25.991809Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.991809Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:81721910f72602d5895b4682d344719d8138b7e0e155c25930cbec15c0b88cf5","observation_id":"0efe1c4b-d7b0-4ddd-a419-36f3eb51cfaf","resolution":{"observed_at":"2026-08-16T10:21:25.991809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03629","last_updated":"2024-07-14T12:40:59Z","snapshot_observed_at":"2026-08-16T17:22:56.767631Z","submitted_at":"2022-02-08T03:55:01Z","title":"Survey of Hallucination in Natural Language Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03629","snapshot_observed_at":"2026-08-16T10:21:25.977125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.977125Z"},"links":{"cited_paper":"/paper/2202.03629","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:0e998a09bb7db9353f70042793846b3d5446fd2e873e8b84e5e6dc2bb7e25cf4","observation_id":"4d31df53-2e51-423e-8943-b07bd5b4e0c3","resolution":{"observed_at":"2026-08-16T10:21:25.977125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:27.031813Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":"4eb87a7b-efed-4971-87d9-7ae9f7dc1391","year":null},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.000929Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:347d026a144ce88e64e922e11cb1a858b3afaf6537cae94958f93c3e8a8e858d","observation_id":"870190f9-74a1-45c8-8fbe-e05ab7516e85","resolution":{"observed_at":"2026-08-16T10:21:27.036109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.010113Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.010113Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:616337fd740a8a0b2151c41799979b4c880abd678c0c68024d7e9cf2394ff070","observation_id":"93d24641-1b2c-4c0d-aaca-6858d73aca31","resolution":{"observed_at":"2026-08-16T10:21:26.010113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-16T15:30:47.997499Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-16T10:21:26.014390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.014390Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:ccb3703d25ec2d89dea40fdb4745611828f2d88eb038ac39fbff1c27725bed5d","observation_id":"0959be33-1ff3-4d99-bf62-e0700bccf69b","resolution":{"observed_at":"2026-08-16T10:21:26.014390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18486","last_updated":"2023-07-05T16:19:38Z","snapshot_observed_at":"2026-08-16T15:28:41.513819Z","submitted_at":"2023-05-29T12:37:21Z","title":"A Systematic Study and Comprehensive Evaluation of ChatGPT on Benchmark Datasets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18486","snapshot_observed_at":"2026-08-16T10:21:25.996298Z","title":"Saiful Bari, Mizanur Rahman, Md Am- ran Hossen Bhuiyan, Shafiq Joty, and Jimmy Xiangji Huang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.996298Z"},"links":{"cited_paper":"/paper/2305.18486","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:2404fec4a7e62c5e1d16f47c3164b5f1bac312fef7aee91dd10e6742a93ecd20","observation_id":"ee5747c1-46fa-4e75-8990-c261c810452c","resolution":{"observed_at":"2026-08-16T10:21:25.996298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07889","last_updated":"2024-02-06T17:05:58Z","snapshot_observed_at":"2026-08-16T15:15:59.443149Z","submitted_at":"2023-07-15T22:02:12Z","title":"LLM Comparative Assessment: Zero-shot NLG Evaluation through Pairwise Comparisons using Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07889","snapshot_observed_at":"2026-08-16T10:21:26.022925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.022925Z"},"links":{"cited_paper":"/paper/2307.07889","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:733c034871e24203c6133ad38bba524161da8c2593913a557ef0e9e9f7aea3da","observation_id":"35823cd7-a060-4ab9-aea8-d1ab449fe8db","resolution":{"observed_at":"2026-08-16T10:21:26.022925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T10:21:26.027310Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.027310Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:270d6039b61c4ce3ecaafab61fd976cd7e97e74f44a99038caa512556134fdf4","observation_id":"9b225c7c-cd45-4633-8dac-12ecded4109d","resolution":{"observed_at":"2026-08-16T10:21:26.027310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14251","last_updated":"2023-10-11T05:27:50Z","snapshot_observed_at":"2026-08-16T15:30:32.877559Z","submitted_at":"2023-05-23T17:06:00Z","title":"FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14251","snapshot_observed_at":"2026-08-16T10:21:26.031803Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.031803Z"},"links":{"cited_paper":"/paper/2305.14251","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:e942cc36f1afa5c4656c2d7c371a298327f48c04a732b1d269c52941c4bf8ec2","observation_id":"bb4d1a79-bfbd-4e6a-b51d-b83065467d81","resolution":{"observed_at":"2026-08-16T10:21:26.031803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:27.007396Z","title":null,"venue":null,"work_id":"787a51e5-4ff7-4d17-8722-c87bdb9bc9cd","year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.036149Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:e74b4503b8518abc47c7f8b8c33d9db12830d7d21212e45e5001d52aad8a9b24","observation_id":"4d529b29-d329-478b-a4fc-f0d04736caa1","resolution":{"observed_at":"2026-08-16T10:21:27.011563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-16T10:21:26.018557Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.018557Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:4ce6d5de18f9acbf50fa81689da8f89624341a094626f8f84a46d2df1c92de7e","observation_id":"a471f6db-7abd-4408-841f-be27588aef51","resolution":{"observed_at":"2026-08-16T10:21:26.018557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.044346Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.044346Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:8c2c09ac710e51d46c6f4e08b6bbf22833841f615ec28699907de72afdf8e12a","observation_id":"5632106d-e38c-4b74-adf5-33ced804eee7","resolution":{"observed_at":"2026-08-16T10:21:26.044346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.966391Z","title":null,"venue":null,"work_id":"c9aab0b0-ce8c-4f1a-8ab8-04888df2ef7e","year":2009},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.048915Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:82e4d8a614b0ac7b46aace193de7de148b2f216e6180cb03c94bfc71f746d6a4","observation_id":"4956660f-98d4-4e57-9a76-0b9068815c59","resolution":{"observed_at":"2026-08-16T10:21:26.971017Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.053539Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.053539Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:efb807cd7af26bfb01f42597a926a761bd9b681e99ed204e401799f6eed4d405","observation_id":"19e2b9e0-5e67-48e0-9f8d-d34f9cdc8cd9","resolution":{"observed_at":"2026-08-16T10:21:26.053539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00343","last_updated":"2022-03-01T10:41:17Z","snapshot_observed_at":"2026-08-16T17:17:51.330848Z","submitted_at":"2022-03-01T10:41:17Z","title":"Read before Generate! Faithful Long Form Question Answering with Machine Reading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00343","snapshot_observed_at":"2026-08-16T10:21:26.058961Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.058961Z"},"links":{"cited_paper":"/paper/2203.00343","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:39df7b7c3a1a381abcb640f2c58889ed44ca64f26b2f5ba740a1fcc563371183","observation_id":"df03481d-2457-44a0-a66c-478b518706a2","resolution":{"observed_at":"2026-08-16T10:21:26.058961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.992057Z","title":null,"venue":null,"work_id":"5b3b8d1a-4706-4429-bb14-b12857e9dca7","year":2025},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.040419Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:541d8316924bb546a800c9b6739a1a65ae0f6046875efa56fe0e8408042c5a4e","observation_id":"f5619ef3-05b5-4d24-a1a7-6164bcab6724","resolution":{"observed_at":"2026-08-16T10:21:26.996376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.950425Z","title":null,"venue":null,"work_id":"f006f905-fc29-4077-aa65-a2f6ca8480c4","year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.067967Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:689f30c30c6937618ad8a986b66d024078213a49fc97b1d8984b64018238bc23","observation_id":"464041cb-7668-40bc-ab32-c4c800eb77a6","resolution":{"observed_at":"2026-08-16T10:21:26.955258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T10:21:26.072226Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.072226Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:f88c79a8cda639160fb4fbcf7e40af5b807d2de4fa04000fe240a2be0901cf36","observation_id":"7b2978f5-28f0-426e-aaa8-e1a7e330ecdc","resolution":{"observed_at":"2026-08-16T10:21:26.072226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10817","last_updated":"2024-07-15T15:33:45Z","snapshot_observed_at":"2026-08-16T13:34:06.565941Z","submitted_at":"2024-07-15T15:33:45Z","title":"Foundational Autoraters: Taming Large Language Models for Better Automatic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10817","snapshot_observed_at":"2026-08-16T10:21:26.076185Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.076185Z"},"links":{"cited_paper":"/paper/2407.10817","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:b458ef37f6a0b6bba1519e08c8f1c9a94442d96f3ad16b4ecb61f0f71ee2bb36","observation_id":"d495196b-ab18-4795-94f8-1b9ed58bd2d9","resolution":{"observed_at":"2026-08-16T10:21:26.076185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-16T15:50:04.573553Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-16T10:21:26.080417Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.080417Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:1aabb131d175ed47cf67b77d5d56eed85af266b29a195fc8575e44a06a5e4c0a","observation_id":"dee73ccb-8926-4517-a994-d3ec9cc72a61","resolution":{"observed_at":"2026-08-16T10:21:26.080417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16313","last_updated":"2024-12-16T07:11:59Z","snapshot_observed_at":"2026-08-16T20:32:13.525345Z","submitted_at":"2024-02-26T05:31:34Z","title":"Chain-of-Discussion: A Multi-Model Framework for Complex Evidence-Based Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16313","snapshot_observed_at":"2026-08-16T10:21:26.063537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.063537Z"},"links":{"cited_paper":"/paper/2402.16313","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:3ee76f673ee035998d440a35f1a16d34d601530b9df78183adb628425d32c294","observation_id":"c9dd1258-4c87-445d-8027-3d947f69c39a","resolution":{"observed_at":"2026-08-16T10:21:26.063537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-16T10:21:26.088890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.088890Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:ff050b3f2c1cc2fb4eb6332309edb308c698023bdbc212ea8d99845e8a980eaa","observation_id":"ee0e2d8b-5bfd-4410-a804-db642cd30dc2","resolution":{"observed_at":"2026-08-16T10:21:26.088890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.934383Z","title":null,"venue":null,"work_id":"5cce6ec2-a69d-49b1-b276-c577c4d22e0c","year":2025},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.093480Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:505f31cd5ae72972f7f3f2e99ab860aad87e76930af6d0fb861fabff58413e3c","observation_id":"c672f35b-7bcd-4386-b51f-3e89714af8f6","resolution":{"observed_at":"2026-08-16T10:21:26.939641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18201","last_updated":"2023-05-29T16:54:24Z","snapshot_observed_at":"2026-08-16T15:28:37.123776Z","submitted_at":"2023-05-29T16:54:24Z","title":"A Critical Evaluation of Evaluations for Long-form Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18201","snapshot_observed_at":"2026-08-16T10:21:26.097838Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.097838Z"},"links":{"cited_paper":"/paper/2305.18201","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:44fd2bf8662fc847cc6714730de431739b253d79c668f85f41550683c98582aa","observation_id":"23252623-4f54-49d5-a877-3f665cc40096","resolution":{"observed_at":"2026-08-16T10:21:26.097838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05661","last_updated":"2024-07-03T01:29:20Z","snapshot_observed_at":"2026-08-16T14:44:45.233187Z","submitted_at":"2023-11-09T08:00:32Z","title":"Prompt Engineering a Prompt Engineer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05661","snapshot_observed_at":"2026-08-16T10:21:26.102266Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.102266Z"},"links":{"cited_paper":"/paper/2311.05661","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:de1288136266c05a42881c26427205febab8856d6fc5773189a0048e5846c5a3","observation_id":"56a860e5-b077-4fab-a327-b6b3f30c6384","resolution":{"observed_at":"2026-08-16T10:21:26.102266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-16T10:21:26.084583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.084583Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:f2215e0cd5d7cd24374a0bd551d7c0d88992af5d169d857ce5a4a95352dc5e5f","observation_id":"8b488337-628e-4615-87b9-bc9db51940b7","resolution":{"observed_at":"2026-08-16T10:21:26.084583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-16T10:21:26.112703Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.112703Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:624bd465f2873ff7f2a53b1a1ab7bb8c59b7cd612f56554aea65c853a9c44d76","observation_id":"4d74b7f9-b248-40e0-b4dc-276ae4091f6d","resolution":{"observed_at":"2026-08-16T10:21:26.112703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07398","last_updated":"2023-12-17T09:39:05Z","snapshot_observed_at":"2026-08-16T14:35:25.703043Z","submitted_at":"2023-12-12T16:14:43Z","title":"LLMEval: A Preliminary Study on How to Evaluate Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07398","snapshot_observed_at":"2026-08-16T10:21:26.117543Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.117543Z"},"links":{"cited_paper":"/paper/2312.07398","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:f1e593775ba5a5397e259dac89fccb53bfd6c59479e707f870a2ed0f34c371b5","observation_id":"75241382-06bd-4b0c-9af0-5f7d869d76bf","resolution":{"observed_at":"2026-08-16T10:21:26.117543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.122295Z","title":"Meyer, and Stef- fen Eger","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.122295Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:5223f45946e6e065a1c56c1130cc9f660e8b29788f8846dde7a9408be7a09498","observation_id":"d1fbc60f-3d97-43af-b20c-3fd2ff306ce8","resolution":{"observed_at":"2026-08-16T10:21:26.122295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:26.908218Z","title":null,"venue":null,"work_id":"9c9a89fe-fed8-44ab-a22a-3dc6f42612be","year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.126300Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:764cf7c7dad453f402fe7b09b08ff8b4563bbf689c1e18b17dc176463e167310","observation_id":"d823a645-2ceb-4416-b70a-a68d3e580128","resolution":{"observed_at":"2026-08-16T10:21:26.913420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10928","last_updated":"2024-04-14T04:29:51Z","snapshot_observed_at":"2026-08-16T15:14:38.528933Z","submitted_at":"2023-07-20T14:56:35Z","title":"FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10928","snapshot_observed_at":"2026-08-16T10:21:26.107650Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.107650Z"},"links":{"cited_paper":"/paper/2307.10928","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:ca098fed559167e8be06930982235104195b48781858e1d4fc00bd4e68d514f6","observation_id":"84a6d43c-35b1-476d-aa3a-e21e8df48cbc","resolution":{"observed_at":"2026-08-16T10:21:26.107650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:27.056448Z","title":"In Advances in Information Retrieval: 42nd European Conference on IR Research, ECIR 2020, Lisbon, Portugal, April 14–17, 2020, Proceedings, Part II 42","venue":null,"work_id":"43622ec7-54a6-455d-9f73-1620519aee9d","year":2020},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.972464Z"},"links":{"citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:be202dd7ca539513ec7ef1dc7bbb98a5e243619df1b477bd4517fb9d5175d6a6","observation_id":"fd397251-7d15-4dde-94fb-5ad550defb35","resolution":{"observed_at":"2026-08-16T10:21:27.061012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-16T10:21:26.005837Z","title":"arXiv:2211.09110 (Nov","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.005837Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:18dfafaad35d89b61cd5d380462d032e44feb30b0b7abade3539255d260b3ba9","observation_id":"4e61d8c8-5d00-4acf-be30-a673f89df2b3","resolution":{"observed_at":"2026-08-16T10:21:26.005837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08210","last_updated":"2023-09-15T07:22:56Z","snapshot_observed_at":"2026-08-16T15:00:29.690416Z","submitted_at":"2023-09-15T07:22:56Z","title":"Investigating Answerability of LLMs for Long-Form Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08210","snapshot_observed_at":"2026-08-16T10:21:25.893306Z","title":"arXiv:2309.08210 (Sept","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.893306Z"},"links":{"cited_paper":"/paper/2309.08210","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:d4c9c67e2b8d5c2b0050eb162df93afd6f424622011b31b603141273ec27e3be","observation_id":"b468ece7-0fa4-4138-942d-721e0eb5f7a2","resolution":{"observed_at":"2026-08-16T10:21:25.893306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-16T10:21:25.954165Z","title":"arXiv:2406.12793","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:25.954165Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:456b44b630d76023a02330f93d6a1152948a8cbeb971ab47cb2635a2a7ba1a80","observation_id":"c93eb2fc-df8a-430a-843e-2975a7da8c10","resolution":{"observed_at":"2026-08-16T10:21:25.954165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-16T18:33:34.148937Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2504.18413."}