{"as_of":"2026-08-13T23:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82892813d00c781dc493a06490459b62f39889c46c1a4f46999e7dd843989dd9","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:37:54.170067Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.09492/citation-record","integrity":"/paper/2411.09492/integrity","json":"/paper/2411.09492/citation-record.json","paper":"/paper/2411.09492"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T20:37:54.104239Z","title":"CoRR, abs/2110.14168","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.104239Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:d33a4c4a4fb443fa4a796ec4f9ff2e765832bf35ca0ce07cecdd121e9317563d","observation_id":"a583e0b2-fff4-43bc-a625-9b19763b4f7f","resolution":{"observed_at":"2026-08-12T20:37:54.104239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.396053Z","title":"In 9th Inter- national Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, May 3-7,","venue":null,"work_id":"691c92e6-17d5-4918-8f6b-834925363b4e","year":2021},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.113503Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:4015fcee632c48f4038c714e89dd1095808884ff91764e0dce87582573fb9da5","observation_id":"3d2f28a7-7d32-4941-8856-37071717a3eb","resolution":{"observed_at":"2026-08-12T20:37:54.400214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.384344Z","title":"In Forty- first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27,","venue":null,"work_id":"ec39f64e-bc0e-4083-82a9-a87f7296855a","year":2024},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.117708Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:fb17c170bb27783b008c4e9c661a50ac806b185521381541b7c52c50a65df825","observation_id":"2fb805f6-ffcb-4c88-a22a-05b1a3061333","resolution":{"observed_at":"2026-08-12T20:37:54.388444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.372428Z","title":"In Findings of the Association for Computational Linguistics, ACL 2024, Bangkok, Thailand and virtual meeting, August 11-16, 2024 , pages 15670–15693","venue":null,"work_id":"6df7d953-51dc-4b14-ada7-98f00bb0c56e","year":2024},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.122331Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:6a32c5a1ae17bb22fdc403ebb39251cc5d3fa5c7468acbdb423a60add6de8705","observation_id":"cb63b25f-2bbb-4426-b3e7-4107b98c1173","resolution":{"observed_at":"2026-08-12T20:37:54.376270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-12T20:37:54.131256Z","title":"CoRR, abs/2311.12022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.131256Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:4358c99173cde4890f584f588903b16e8abdba5a9c6200450b8b3c57ce01bcd6","observation_id":"ad58dcd4-a2d0-4d59-ba8a-fb84796bdf88","resolution":{"observed_at":"2026-08-12T20:37:54.131256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.360184Z","title":"In Proceedings of the 62nd An- nual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2024, Bangkok, Thailand, August 11-16, 2024, pages 1913–","venue":null,"work_id":"3d6227d1-0cf8-46e0-b042-ac22c8a064a0","year":2024},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.135748Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:b358e2839c68393e68ce76a69f54d4970224f195a54f00a79499fc86c147bd25","observation_id":"7605f53c-3c0a-46cd-9332-dc91925f1006","resolution":{"observed_at":"2026-08-12T20:37:54.364381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.348063Z","title":"In The Eleventh International Conference on Learning Representa- tions, ICLR 2023, Kigali, Rwanda, May 1-5,","venue":null,"work_id":"319b1846-e877-4bf5-ad31-d30573603790","year":2023},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.140824Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:555598e0163e6f784a9b095df6e5bbb271c304deb809648de2de04da00602e57","observation_id":"f70cf994-8ab0-4101-ae3e-27dc5f1c983a","resolution":{"observed_at":"2026-08-12T20:37:54.351780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.335784Z","title":null,"venue":null,"work_id":"481c5f69-c5d5-4bf5-921c-b01e0339e5c5","year":2024},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.144146Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:b9d4b93904bdad49409693339f5d3e076ff80f82df898695e2fe572c2aefce5b","observation_id":"7379018f-5b3a-4b18-9505-ad6ef93d5d10","resolution":{"observed_at":"2026-08-12T20:37:54.339779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T20:37:54.147432Z","title":"CoRR, abs/2307.09288","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.147432Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:95050fa830ab955dbc78f5b198661c152912321025347b832ba14a35681447b2","observation_id":"e383a4ab-8d89-4145-8b6b-890585a9fea3","resolution":{"observed_at":"2026-08-12T20:37:54.147432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-12T20:37:54.151127Z","title":"CoRR, abs/2406.19314","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.151127Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:26fb5388c8d13f90a1af13fa94d7f28716cf58a10aa7bb033fcfd5978af56b90","observation_id":"956f0f73-2f92-44af-87d0-be59b52faf94","resolution":{"observed_at":"2026-08-12T20:37:54.151127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09705","last_updated":"2023-07-19T01:22:40Z","snapshot_observed_at":"2026-08-13T10:52:57.236409Z","submitted_at":"2023-07-19T01:22:40Z","title":"CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09705","snapshot_observed_at":"2026-08-12T20:37:54.155352Z","title":"CoRR, abs/2307.09705","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.155352Z"},"links":{"cited_paper":"/paper/2307.09705","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:79e4ac2499fed6b2a22657dab828363b16555d16de114a0bc44814a0502f35cf","observation_id":"0246c4e8-d247-481b-88e9-1aac8e0c8e65","resolution":{"observed_at":"2026-08-12T20:37:54.155352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.321629Z","title":"In Forty-first In- ternational Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27,","venue":null,"work_id":"e1d0c32a-fc9f-4f9d-a9df-e997d9cf588e","year":2024},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.158900Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:99c25ce86e6d8e52092c7e37f18a77fbf9ca611bf39684f1b85bcaf7821bd598","observation_id":"d17697b9-b177-4fa2-81d9-132ac127f217","resolution":{"observed_at":"2026-08-12T20:37:54.326717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T20:37:54.162015Z","title":"CoRR, abs/2407.10671","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.162015Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:2e939025c25aa304fe4228f94ff5729c78360a59231577855848c1f7da4fa6fc","observation_id":"09c81f42-75d0-428d-a6fb-c03d622948c1","resolution":{"observed_at":"2026-08-12T20:37:54.162015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.291417Z","title":"In The Eleventh Inter- national Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1-5,","venue":null,"work_id":"1c8cbf3e-499b-46fe-a1c2-7926438848d3","year":2023},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.170067Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:eab0ad59c1e80f69f9b9cb4b5246d65e0b04f1a1611f4f7ab8b5e4a85e8e06e9","observation_id":"ed924ecb-3d29-45f3-8873-19acf9d66081","resolution":{"observed_at":"2026-08-12T20:37:54.299173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.308005Z","title":"In Proceedings of the 54th Annual Meet- ing of the Association for Computational Linguistics, ACL 2016, August 7-12, 2016, Berlin, Germany, Vol- ume 2: Short Papers","venue":null,"work_id":"97a6a1af-91bf-40a8-b8e4-ce2610545125","year":2016},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.166154Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:4889ad5527552daad61cac6bcee64ca862a94bea1d48bc87f597292ee9dffe8e","observation_id":"692d58da-d245-4dad-a178-50b5306446e4","resolution":{"observed_at":"2026-08-12T20:37:54.312363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.419790Z","title":null,"venue":null,"work_id":"a0abeb0a-5e53-4724-bc36-2aad8d914094","year":2020},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.099706Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:dc3608094a56bb2c185294220922539cda5388301d27e7620fe68eab6804963c","observation_id":"23b9a928-9cce-46b4-8be9-bac2dae23443","resolution":{"observed_at":"2026-08-12T20:37:54.423820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-12T20:37:54.094498Z","title":"CoRR, abs/2107.03374","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.094498Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:4bbdc09be1d3c92243e3cf37a7b3448b472b2442e186e9f46d85d3d6b70499df","observation_id":"026deebf-ed8e-4443-920f-e1c366e1d565","resolution":{"observed_at":"2026-08-12T20:37:54.094498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T20:37:54.126879Z","title":"CoRR, abs/2303.08774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.126879Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:0eb0fc25cbdeed10ec39431caeffec4714d49f66f3ca6b3e6542d11a0004113d","observation_id":"ecc7abe4-6737-4f1a-8d3f-e168d375c609","resolution":{"observed_at":"2026-08-12T20:37:54.126879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:37:54.407955Z","title":null,"venue":null,"work_id":"0d85bc76-2e94-4d33-9b1b-3469efbe3b6a","year":2024},"citing_paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T20:37:54.108897Z"},"links":{"citing_paper":"/paper/2411.09492"},"observation_digest":"sha256:229dcf52bcae3080969d07b71cac9119e025c14c4bc404e137ae100dda5f78db","observation_id":"6cc66206-08b5-4892-a127-27a2e8caff87","resolution":{"observed_at":"2026-08-12T20:37:54.411886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.09492","last_updated":"2024-11-14T14:58:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T20:33:12.000869Z","submitted_at":"2024-11-14T14:58:38Z","title":"MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2411.09492."}