{"as_of":"2026-08-16T11:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a0a5b6d4d65583ae2952fd0969786426de15f605f0633748267d04208727750","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:45:00.493289Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.15215/citation-record","integrity":"/paper/2506.15215/integrity","json":"/paper/2506.15215/citation-record.json","paper":"/paper/2506.15215"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.422872Z","title":null,"venue":null,"work_id":"c88a7d7f-f21d-4c89-85ac-a20cb69ff4d0","year":2019},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.223221Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:df5363026b3d19280cfc2b89992fdeaabba7a9b38563367db3bf673ccc3484cf","observation_id":"cab2b413-7886-42dc-a9b5-33ced88ae26f","resolution":{"observed_at":"2026-08-15T19:45:01.427206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.228082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.228082Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:205186632fbbeda294d637177deb6e09c04e42b0f84830d53c8fe47e3ab93ec9","observation_id":"77dfb09c-3b72-41a4-b19b-09c24fa066f7","resolution":{"observed_at":"2026-08-15T19:45:00.228082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08037","last_updated":"2023-02-10T20:04:05Z","snapshot_observed_at":"2026-08-13T13:20:36.379988Z","submitted_at":"2022-12-15T18:45:29Z","title":"Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08037","snapshot_observed_at":"2026-08-15T19:45:00.232911Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.232911Z"},"links":{"cited_paper":"/paper/2212.08037","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:b887bb2c7087ce5696824ca381970743d39167500b87f3094cba16eee7758d9e","observation_id":"7a90e01e-c399-4af9-8222-557df2171d17","resolution":{"observed_at":"2026-08-15T19:45:00.232911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.290","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.550759Z","title":null,"venue":null,"work_id":"52050e6e-9a21-4ba5-b52f-c6646e5f1398","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.237441Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:5f2bcf2b523f2d49db435c1bee667cd63270af0ca7f2c6fc5eca8edeee9cea10","observation_id":"04929aa5-225e-4415-b47b-b9a4dba33c0d","resolution":{"observed_at":"2026-08-15T19:45:00.555000Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.399925Z","title":null,"venue":null,"work_id":"6ba4f747-be86-4aca-8fa3-6458be07a970","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.241696Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:abebab55d773db81e9894356fb7b74cd37599662b27c92fbd08a8a29833bcbf5","observation_id":"5b0a759d-18cc-48cf-bdb7-2189e37516c4","resolution":{"observed_at":"2026-08-15T19:45:01.404139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.384314Z","title":null,"venue":null,"work_id":"5f5e3dc5-6319-4f6f-bf07-0ea6846c53d5","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.245946Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:1422f80d9fb12affa96d943b6e8c6f618ba69a0b22ef2c8a1b45944bdf2f88a8","observation_id":"9b96b3a3-3256-40d2-a91e-8f472a199641","resolution":{"observed_at":"2026-08-15T19:45:01.389805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.250522Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.250522Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:37f36ddf12f8b301ca2b64fd00a867d2853f8602202b6d141aec37f370bfbd42","observation_id":"bffcf62b-901c-4143-932e-258657a0759b","resolution":{"observed_at":"2026-08-15T19:45:00.250522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07654","last_updated":"2022-10-26T10:47:17Z","snapshot_observed_at":"2026-08-16T10:17:55.882554Z","submitted_at":"2022-02-15T18:53:58Z","title":"Tomayto, Tomahto. Beyond Token-level Answer Equivalence for Question Answering Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07654","snapshot_observed_at":"2026-08-15T19:45:00.254426Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.254426Z"},"links":{"cited_paper":"/paper/2202.07654","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:ffc841c3fba03192b45cbb573152f7783ddd8787c8de7acaa94d5af5003e109e","observation_id":"19b24581-bb07-4a43-8fee-d35be76e545c","resolution":{"observed_at":"2026-08-15T19:45:00.254426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-15T19:45:00.258825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.258825Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:fbe24a99f97345104054d938df7d3292778d135b7a132ce0fc6bcdabd6599e2e","observation_id":"f942858e-7d6e-4d50-b086-996ef081efb3","resolution":{"observed_at":"2026-08-15T19:45:00.258825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.262982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.262982Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:2540c6c6e6031ea1bcc2579975847b11a42e92dd464652670b3d2522267aa863","observation_id":"51a02e04-ae87-41ff-af63-b3e00838d3a8","resolution":{"observed_at":"2026-08-15T19:45:00.262982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.267222Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.267222Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:44b98d79c384e0cac60193b34234403964a2251664e8b5b5cb0f73f4f78123b0","observation_id":"a230c525-71d6-466e-b6b0-4f5ce748cacc","resolution":{"observed_at":"2026-08-15T19:45:00.267222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03608","last_updated":"2024-10-04T17:09:08Z","snapshot_observed_at":"2026-08-13T16:21:44.289832Z","submitted_at":"2024-10-04T17:09:08Z","title":"TICKing All the Boxes: Generated Checklists Improve LLM Evaluation and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03608","snapshot_observed_at":"2026-08-15T19:45:00.271331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.271331Z"},"links":{"cited_paper":"/paper/2410.03608","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:09f3f14df898473f4ca2f03bb51c5d2933c9989db6ff6ddb0956064f05a59707","observation_id":"bdb7910f-223e-4190-abfa-a70b082ed9f5","resolution":{"observed_at":"2026-08-15T19:45:00.271331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.07662","last_updated":"2021-02-15T16:47:00Z","snapshot_observed_at":"2026-08-09T09:26:16.401552Z","submitted_at":"2021-02-15T16:47:00Z","title":"Overview of the TREC 2020 deep learning track","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.07662","snapshot_observed_at":"2026-08-15T19:45:00.275562Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.275562Z"},"links":{"cited_paper":"/paper/2102.07662","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:77ee23366fb7b390669404e8f55d01c05a325574908fdfa52d2e825158f17372","observation_id":"d6dfd2b0-4d9e-489f-8b36-d7e00adc3873","resolution":{"observed_at":"2026-08-15T19:45:00.275562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.07820","last_updated":"2020-03-18T16:56:56Z","snapshot_observed_at":"2026-08-10T13:25:09.780441Z","submitted_at":"2020-03-17T17:12:36Z","title":"Overview of the TREC 2019 deep learning track","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.07820","snapshot_observed_at":"2026-08-15T19:45:00.279742Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.279742Z"},"links":{"cited_paper":"/paper/2003.07820","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:66ac2c5cf6e573038069e6d6977316b5301ab6beb3736b4eedfd7a7f20c409a0","observation_id":"64553bc9-4dd0-4d36-a10f-95dbce60be3c","resolution":{"observed_at":"2026-08-15T19:45:00.279742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.345226Z","title":null,"venue":null,"work_id":"4683c9d8-d138-4c73-9760-c4a7a91757fa","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.283721Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:b6bf6372c46c3789cd71c181c85e590756d27a0a383e98cc00f4e1521179f3b5","observation_id":"4e6dd2cc-bcd4-4fb1-853f-38f64dd954f8","resolution":{"observed_at":"2026-08-15T19:45:01.349723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.287502Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.287502Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:7d3a8beaa096ca6be04d474f01374477aeee072006cfbb57966e39dcbf72ac8c","observation_id":"39cdef63-81bb-43ad-a335-6ee2de80f052","resolution":{"observed_at":"2026-08-15T19:45:00.287502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.320809Z","title":null,"venue":null,"work_id":"5b4836f4-3285-439e-8433-6b9ba70c67fe","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.291301Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:af14ec4c162565142dc7b303b56f51ef743c849307c1b6567ce426e3d1391833","observation_id":"188b66ca-9a11-47ef-bbfd-adeaf362a40f","resolution":{"observed_at":"2026-08-15T19:45:01.326639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-15T19:45:00.295124Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.295124Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:7408a518ebac70132e5e371ac433aa0f3a63aa38d990a7dbfd19f0c42f47fcb9","observation_id":"90b2454b-39e6-4fe2-a4b3-2235d29eaa7b","resolution":{"observed_at":"2026-08-15T19:45:00.295124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.306169Z","title":null,"venue":null,"work_id":"fd9c6966-3ef1-43cf-aab5-b26e12bf0118","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.299498Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:5296a8e36832473de0e8d16ca4dbe6270780d83806d3992ccf92b73bb8004d39","observation_id":"b1ac35d1-001c-44b1-b27c-67a7d3597b2f","resolution":{"observed_at":"2026-08-15T19:45:01.311234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.290118Z","title":null,"venue":null,"work_id":"0d5251cc-49b4-4924-afd1-ef6e258cf8ac","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.303248Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:f93bdef6b1d97e09e0d670994a5159284fb6bd22806d6479cbc6e2d1c72dc205","observation_id":"9e437ad0-0083-427e-bc05-367cf1236cff","resolution":{"observed_at":"2026-08-15T19:45:01.296361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.274719Z","title":null,"venue":null,"work_id":"b72ec0a1-4be8-441e-af37-6f247593133c","year":2020},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.307042Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:a2411130d0695da68f056c0e680793a6a5925fac14e856a5c218c18e8eb5f157","observation_id":"e07a39d9-3cac-4b5e-bc9c-ccb4321e7575","resolution":{"observed_at":"2026-08-15T19:45:01.279013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14486","last_updated":"2024-05-23T12:18:11Z","snapshot_observed_at":"2026-08-12T23:59:55.687766Z","submitted_at":"2024-05-23T12:18:11Z","title":"RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14486","snapshot_observed_at":"2026-08-15T19:45:00.310927Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.310927Z"},"links":{"cited_paper":"/paper/2405.14486","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:b0588f9cc99c3291c34ced38d1a80b839579d2305046b29ff22b30d71b9a5e8b","observation_id":"62faccee-9efa-415d-bca4-289ed6ae5ef5","resolution":{"observed_at":"2026-08-15T19:45:00.310927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.259510Z","title":null,"venue":null,"work_id":"47c25d97-fdbb-4e3d-b778-f606503046ac","year":2019},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.314971Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:d44a046efef25eced8fabb64a01104ac846a9bd753c72dd1a7b0302e7eee73cf","observation_id":"f4fee360-16c6-42cd-86f8-664f347f7afa","resolution":{"observed_at":"2026-08-15T19:45:01.264148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.245734Z","title":null,"venue":null,"work_id":"301273ef-429f-425d-8eb6-693a2620ca24","year":2022},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.318829Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:c5cd30aedf470e6b8301e2d50f0630d2db6ec65d83b408c4335e7983c43c9655","observation_id":"c43cc8f4-97ae-43be-bc6e-98a1a25536e4","resolution":{"observed_at":"2026-08-15T19:45:01.250003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-13T05:47:51.554813Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-15T19:45:00.322748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.322748Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:14a3c855f22faf975f7c1aa974f8fc165c6a3035b8828acf8b6fd412890499d2","observation_id":"d51b3700-0f16-4a5f-b047-83286e9cbf86","resolution":{"observed_at":"2026-08-15T19:45:00.322748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.327028Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.327028Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:581c684aa2324d5bf91e6c9232c9158fc4cebb622106ee3f5312e075c1d6f686","observation_id":"acd14c6a-858c-4456-941c-c55520a5e053","resolution":{"observed_at":"2026-08-15T19:45:00.327028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.232333Z","title":null,"venue":null,"work_id":"8bd19811-4431-4934-b72c-b0b0a3c22adf","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.331107Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:50826a7328c69e3d8a198d327fbe2a5fe9388994bdc2d65f19188662f6f887d0","observation_id":"a39978f6-fb4c-4c84-828e-7b534389819c","resolution":{"observed_at":"2026-08-15T19:45:01.236365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-13T05:54:10.811176Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-15T19:45:00.334851Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.334851Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:a9d39cc265573f2f4dea8d7397947a95a761f9504ccde3e22d0e20566224875e","observation_id":"8f2351c4-c06f-413a-b6d3-56087e6aaff1","resolution":{"observed_at":"2026-08-15T19:45:00.334851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19740","last_updated":"2025-01-18T03:27:45Z","snapshot_observed_at":"2026-08-15T17:16:11.897352Z","submitted_at":"2023-10-30T17:04:35Z","title":"Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19740","snapshot_observed_at":"2026-08-15T19:45:00.338723Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.338723Z"},"links":{"cited_paper":"/paper/2310.19740","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:49c684ac255f091861cb3ddbf7b3f81121b360b30c075813de139a84a118ceba","observation_id":"9016b8df-771b-4b85-9bca-4f09cbc1c426","resolution":{"observed_at":"2026-08-15T19:45:00.338723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.220233Z","title":null,"venue":null,"work_id":"4564c97b-25cf-42d6-a164-8e8803391ef6","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.342744Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:6e13da1db28a5a675c0ed013bbfe33c347f5c9292a749e4802b85e412590a151","observation_id":"4582eb82-4a3f-4cd2-a242-758bb90e5172","resolution":{"observed_at":"2026-08-15T19:45:01.224292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11161","last_updated":"2024-10-11T20:56:36Z","snapshot_observed_at":"2026-08-13T04:17:10.537369Z","submitted_at":"2024-02-17T01:56:19Z","title":"PEDANTS: Cheap but Effective and Interpretable Answer Equivalence","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11161","snapshot_observed_at":"2026-08-15T19:45:00.346487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.346487Z"},"links":{"cited_paper":"/paper/2402.11161","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:7ec29036f1536c4c5aa5ed54a26c034c737d1adb9accc526914172ba81117faa","observation_id":"d3735528-56bd-4ce2-8eff-b0d4ad54ac44","resolution":{"observed_at":"2026-08-15T19:45:00.346487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.206434Z","title":"Holistic evaluation of language models","venue":null,"work_id":"96dc1421-809b-411f-a79a-079afdd0b96c","year":null},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.350602Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:167baa315e5fc2bf314379225f92ccc168ca38854b8a75dd7fe345d7c6aed688","observation_id":"c141c569-9d3f-4c62-84a0-057e856b7c67","resolution":{"observed_at":"2026-08-15T19:45:01.210863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.354608Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.354608Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:823f403ae011c3cc9379cbc5fcee3d8993651b8470a5fa8e43bd4343387e8e05","observation_id":"48e9a3db-1872-4219-887f-8c980ddb81ee","resolution":{"observed_at":"2026-08-15T19:45:00.354608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.183356Z","title":null,"venue":null,"work_id":"2f0dccc7-efe9-4566-b15f-5b466995090d","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.358379Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:c15878f48e762b4adbc875e11cc28df429caf5124b2211bcbce99c140a08a727","observation_id":"9a86f582-9811-4fb5-9556-6da7ad7a73a6","resolution":{"observed_at":"2026-08-15T19:45:01.187871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12316","last_updated":"2024-03-18T23:21:37Z","snapshot_observed_at":"2026-08-13T00:50:47.642874Z","submitted_at":"2024-03-18T23:21:37Z","title":"OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12316","snapshot_observed_at":"2026-08-15T19:45:00.362498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.362498Z"},"links":{"cited_paper":"/paper/2403.12316","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:4250b5e42e693182028b6844e40ff65faedd9b00075d32504ca4fa5e2fa7eb68","observation_id":"dd7d7a09-bb65-4111-ac15-6e28cc259443","resolution":{"observed_at":"2026-08-15T19:45:00.362498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.169550Z","title":null,"venue":null,"work_id":"bb4f3316-f0e7-471a-b3b5-3448a39336ba","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.366714Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:d395c8d5531b3899d78606f96961df378c3a491fb08756f3a38889059063b913","observation_id":"6a1ca7d6-8926-42df-9c6d-df352ad3be11","resolution":{"observed_at":"2026-08-15T19:45:01.173890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.155225Z","title":null,"venue":null,"work_id":"0e75a01d-66c0-4c01-9733-76b1281ccc39","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.370646Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:86f414b0bf63e0d7223ba703fef62389c2bcbbddbdb38f8dc6aeac34f83f3385","observation_id":"47aa1fdd-5c70-4e71-8016-6aafe118ed3e","resolution":{"observed_at":"2026-08-15T19:45:01.160377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18743","last_updated":"2024-08-25T09:58:57Z","snapshot_observed_at":"2026-08-13T05:13:04.857556Z","submitted_at":"2023-11-30T17:41:30Z","title":"AlignBench: Benchmarking Chinese Alignment of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18743","snapshot_observed_at":"2026-08-15T19:45:00.374438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.374438Z"},"links":{"cited_paper":"/paper/2311.18743","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:a5f8d153a2219539461c97b418104399c23910acc9a901a67845b977226d94a5","observation_id":"ed44843f-1df3-46f5-af14-4712977d543d","resolution":{"observed_at":"2026-08-15T19:45:00.374438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.141295Z","title":null,"venue":null,"work_id":"714f6069-6972-4bf3-a20d-539d2552663a","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.378463Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:9ef3f00496c9843f63cc7dfc5073f031b9520d9933edbe397fa31b064cc90a22","observation_id":"c195fac3-8bf3-4af5-ba65-cf6b7b9f2cc0","resolution":{"observed_at":"2026-08-15T19:45:01.145940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.126693Z","title":null,"venue":null,"work_id":"4deb7b38-5525-40d3-a420-124509859125","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.383275Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:4d31eb322ed6ae61e2386c6c66347b15139fff1936065f5bbf3be4a6ade40d7e","observation_id":"52bf341c-ed7d-47ba-9a64-54f85e0ece8c","resolution":{"observed_at":"2026-08-15T19:45:01.131703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.387151Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.387151Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:4dd88d428cc8016826c9f0e96782e4683aa90e37a98ca8ce1ff091f0290d54ff","observation_id":"70c0fb0b-199c-4e5e-ac85-8dc969ff687b","resolution":{"observed_at":"2026-08-15T19:45:00.387151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07545","last_updated":"2024-06-11T17:59:47Z","snapshot_observed_at":"2026-08-14T02:25:43.490006Z","submitted_at":"2024-06-11T17:59:47Z","title":"Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07545","snapshot_observed_at":"2026-08-15T19:45:00.390932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.390932Z"},"links":{"cited_paper":"/paper/2406.07545","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:0b5a9b1ab1eb0442e744ea4aa794ea4816739686bdf679c757e3ab8d18a131cd","observation_id":"564db687-f0c5-4e8a-8672-0906a0cdf752","resolution":{"observed_at":"2026-08-15T19:45:00.390932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.104679Z","title":null,"venue":null,"work_id":"48c306a2-d5be-4aaa-8b86-1ed03bd84df8","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.395271Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:024251610f72d6f7a7982ba3b1a185db0fec7a7efe8a438f68b42d36c1221f68","observation_id":"afd1e0d3-7977-42ff-a461-52c2c0573bdb","resolution":{"observed_at":"2026-08-15T19:45:01.109573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.091379Z","title":null,"venue":null,"work_id":"505d3a9d-5f26-43de-9687-09f6625b689f","year":2022},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.399223Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:a638b2527504c22160ccaae978c1127374dc2f065463c9e001b1accefc6373fd","observation_id":"a4a3ba3f-0e9a-4c81-ac87-a95226c871ea","resolution":{"observed_at":"2026-08-15T19:45:01.095319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.078101Z","title":null,"venue":null,"work_id":"61691615-7199-424b-9b07-2a759e63ded1","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.403074Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:3a752c3e855e1cb6dd28194b2352f7373819b6f510ef787cbdce117acba607ba","observation_id":"ef97305c-82cf-4115-8bbd-5f83c633ef46","resolution":{"observed_at":"2026-08-15T19:45:01.082296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.063373Z","title":null,"venue":null,"work_id":"ce06fb97-7400-48f5-bc02-58e6969dd2fd","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.407067Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:2c433acaaaa8aada981425a6e1bfe3fb1f8f7a4f505e221be4ae2105608d2cc6","observation_id":"c0061225-0071-4d2f-8b92-f76792db35f1","resolution":{"observed_at":"2026-08-15T19:45:01.068625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.411048Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.411048Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:1c74ba0161e876d2dbb4a9d0ee6efa2eacffab3f62698ec1d643bd4c218893ba","observation_id":"1ad1906f-8df0-473f-b9ca-f92c4cf73f1b","resolution":{"observed_at":"2026-08-15T19:45:00.411048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.415094Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.415094Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:e4c0179f4e185a7ca3dd818558509b4d77c9e55708989a3b7f63490a005d03bd","observation_id":"9b700fff-205e-4e31-998b-d1b1d1638a09","resolution":{"observed_at":"2026-08-15T19:45:00.415094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.041679Z","title":null,"venue":null,"work_id":"140f7d22-5259-46c8-91d5-4c697d24bea7","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.419053Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:b67df2682a23dedba9826537aab1877a4bf60f1229668d8731304b7a8fa60cdc","observation_id":"fa763e5f-fd86-45ce-bd2d-557dfee45d71","resolution":{"observed_at":"2026-08-15T19:45:01.046209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16313","last_updated":"2024-12-16T07:11:59Z","snapshot_observed_at":"2026-08-15T15:03:39.653079Z","submitted_at":"2024-02-26T05:31:34Z","title":"Chain-of-Discussion: A Multi-Model Framework for Complex Evidence-Based Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16313","snapshot_observed_at":"2026-08-15T19:45:00.422874Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.422874Z"},"links":{"cited_paper":"/paper/2402.16313","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:f5706bb8f92d3eca2310b4fe738f7da472fb6513caaff90657c308b65beb069d","observation_id":"0a163b19-d55d-46ec-ab16-5e8daeebceef","resolution":{"observed_at":"2026-08-15T19:45:00.422874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T19:45:00.427310Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.427310Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:a3e4dc244502f99418ca8178206a754bdde3cd5828f886740f8ed6568826840c","observation_id":"c00612bc-e6ae-4158-bddd-14f256028218","resolution":{"observed_at":"2026-08-15T19:45:00.427310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.431194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.431194Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:4abb54b61345b296ae9b0b7882722ac1ef4a2b2c3ccb530123c8d3c12b0d2d0b","observation_id":"9dd91d78-6baf-4aff-bca4-45a9006be1e4","resolution":{"observed_at":"2026-08-15T19:45:00.431194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03304","last_updated":"2024-10-04T03:58:14Z","snapshot_observed_at":"2026-08-13T21:53:01.464998Z","submitted_at":"2023-10-05T04:15:48Z","title":"Learning Personalized Alignment for Evaluating Open-ended Text Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03304","snapshot_observed_at":"2026-08-15T19:45:00.435129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.435129Z"},"links":{"cited_paper":"/paper/2310.03304","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:5e658a6b92706867e67f5479b4be682c65e5bff5fe01328e4e72b90bbf4d6ca3","observation_id":"878a9516-39c3-4593-96ae-aed6472a1f7f","resolution":{"observed_at":"2026-08-15T19:45:00.435129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-15T19:45:00.439244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.439244Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:a198c01bb6dee55adcb53c88eb286e4d5770d69b9ff0974ae7343f2c6b64803e","observation_id":"d1820287-5e3b-495a-827c-f281c52133f7","resolution":{"observed_at":"2026-08-15T19:45:00.439244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-15T19:45:00.443423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.443423Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:fb07a9bf6bb7b38d97f26b448bbb4a62de6b086a1af76c37c1a2d5de5250014c","observation_id":"52f25f5f-57b2-4176-99a5-e27e8c15af7e","resolution":{"observed_at":"2026-08-15T19:45:00.443423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.815","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.526632Z","title":null,"venue":null,"work_id":"68c37b72-02b1-4294-b1b3-6df6418ae2a5","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.447541Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:b09de15c4cbb79a0d0518805866ddc6182149b576bbd79dcd9f5bd22853a69ab","observation_id":"90494498-c253-46c2-a2d7-48b9c4dc892c","resolution":{"observed_at":"2026-08-15T19:45:00.532080Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.021274Z","title":null,"venue":null,"work_id":"34e0c376-1ea9-4f36-8da0-eaa7d7b34d7b","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.451552Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:8632555ee56d5bdd2c71843d454725c2fd6750af552c9941d0fb7cf1897923bd","observation_id":"c03e1945-ee8f-4752-9831-9f8853d114eb","resolution":{"observed_at":"2026-08-15T19:45:01.025191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.455582Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.455582Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:b1b0d8f87259e6214c95652279720182f2819969f29371c78db70952dbbab04c","observation_id":"92c4a518-c6ba-4a9e-8607-a29a47d96bc8","resolution":{"observed_at":"2026-08-15T19:45:00.455582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16708","last_updated":"2025-09-12T01:53:59Z","snapshot_observed_at":"2026-08-15T07:14:27.892153Z","submitted_at":"2024-10-22T05:25:54Z","title":"Atomic Fact Decomposition Helps Attributed Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16708","snapshot_observed_at":"2026-08-15T19:45:00.459744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.459744Z"},"links":{"cited_paper":"/paper/2410.16708","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:399f2f6451e38845287c7118c98e78b1eec5ee6f26e7b5d62a1262640232550e","observation_id":"0cbe3187-4a50-4bc5-81e5-b5c965b60a1c","resolution":{"observed_at":"2026-08-15T19:45:00.459744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T19:45:00.464025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.464025Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:b0a6f8b0cee4dd0e59f94bc7d873c441ea7c660ffe395d82782e558e8936e899","observation_id":"93de009d-3ab4-4bc3-82eb-af06bfe20911","resolution":{"observed_at":"2026-08-15T19:45:00.464025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:01.000057Z","title":null,"venue":null,"work_id":"b2bd1676-4b48-4e4b-9c11-6f99584c72af","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.468156Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:7a46dcbb7fc0199d8e032ce40c1920a368543995d115e0191550b3de7d01bbfb","observation_id":"6c8e4cc1-0bfd-4fe2-ab09-3189954370c4","resolution":{"observed_at":"2026-08-15T19:45:01.004164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16702","last_updated":"2024-05-26T21:33:27Z","snapshot_observed_at":"2026-08-13T04:21:13.229878Z","submitted_at":"2024-05-26T21:33:27Z","title":"Accurate and Nuanced Open-QA Evaluation Through Textual Entailment","version":1},"cited_work":{"arxiv_id":"2405.16702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16702","snapshot_observed_at":"2026-08-15T19:45:00.580512Z","title":"Accurate and Nuanced Open-QA Evaluation Through Textual Entailment","venue":"cs.CL","work_id":"25152c8d-063d-4689-8bdc-1cc2a1868628","year":2024},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.471923Z"},"links":{"cited_paper":"/paper/2405.16702","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:60d7db70b0276353a2fefa97885560c612ba853861aab60e7918b0cfe153e335","observation_id":"37ac97c3-b146-44cb-8d86-410a47b67d04","resolution":{"observed_at":"2026-08-15T19:45:00.585864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.986927Z","title":null,"venue":null,"work_id":"c669b083-edb5-46ea-a5a6-efda89db13e7","year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.476182Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:5a84442a0e4a41e1d43ad488a27b1d6fd3d3a685a9726bc26cb52d35826f5c7c","observation_id":"cd6eeaff-ed55-4f16-b70b-7cf05de86cd8","resolution":{"observed_at":"2026-08-15T19:45:00.991114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.480040Z","title":"Bertscore: Evaluating text generation with bert","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.480040Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:49ebc5574af2fd04f0193252bceb2f3c10cf58a8ee0807379499c03053003313","observation_id":"79f1a1f8-f652-4964-abb6-7937bafe3029","resolution":{"observed_at":"2026-08-15T19:45:00.480040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-08T08:58:54.609425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-15T19:45:00.484031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.484031Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:7b2706641b40b6f38eda372f705a903026f484865e9f0067459502626758ac40","observation_id":"5e9d4b98-9a5e-4136-ba7c-94d16b4bbfc6","resolution":{"observed_at":"2026-08-15T19:45:00.484031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.488102Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.488102Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:06f6efee25d66afe27a9a3f6ea2a5191408baafe83ddf904cb3bc7878c560cf0","observation_id":"272ba5d1-799b-428d-8134-23509a9dd784","resolution":{"observed_at":"2026-08-15T19:45:00.488102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:00.493289Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:00.493289Z"},"links":{"citing_paper":"/paper/2506.15215"},"observation_digest":"sha256:6f7ced7b4a8baab18cdbf8fe84128ac2a9215af78d343e51270ec840b04648f4","observation_id":"37fb8a86-fbf6-44e7-8a68-38f690bc3ecf","resolution":{"observed_at":"2026-08-15T19:45:00.493289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15215","last_updated":"2025-06-18T07:49:13Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T10:18:47.174172Z","submitted_at":"2025-06-18T07:49:13Z","title":"MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.15215."}