{"as_of":"2026-08-10T20:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:231f78c2a2abc585042fcca756841927c08f27a2a29c7771b5aae18cc21c6ea0","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:29:26.820176Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T12:54:27.110593Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T12:55:24.343219Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"cited_work":{"arxiv_id":"2508.21294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21294","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bluex revisited: Enhancing benchmark coverage with automatic captioning","venue":null,"work_id":"46b9776a-e1c8-42d6-84a2-b07b8be7bfad","year":2025},"citing_paper":{"arxiv_id":"2604.14448","last_updated":"2026-04-15T21:54:27Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-15T21:54:27Z","title":"MARCA: A Checklist-Based Benchmark for Multilingual Web Search","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T12:54:27.110593Z"},"links":{"cited_paper":"/paper/2508.21294","citing_paper":"/paper/2604.14448"},"observation_digest":"sha256:a7af4084365d303ab3583ce504f1c319948b6538df74d639ac7843cbde1e0dc8","observation_id":"f81249fd-7d86-4f1a-8a7c-8b0de7829f58","resolution":{"observed_at":"2026-05-10T12:55:24.344982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21294/citation-record","integrity":"/paper/2508.21294/integrity","json":"/paper/2508.21294/citation-record.json","paper":"/paper/2508.21294"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.12049","last_updated":"2025-04-01T12:19:49Z","snapshot_observed_at":"2026-08-09T19:16:54.267722Z","submitted_at":"2024-10-15T20:37:34Z","title":"Sabi\\'a-3 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12049","snapshot_observed_at":"2026-08-05T14:29:23.477617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:23.477617Z"},"links":{"cited_paper":"/paper/2410.12049","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:8960b7752b5db1e9b2b2dc8730ff136d1fac0185b0369bafb6003432a6ad90a3","observation_id":"82dd57ee-7d83-4706-a765-e0811782e711","resolution":{"observed_at":"2026-08-05T14:29:23.477617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:32.133815Z","title":null,"venue":null,"work_id":"cd4d3ba7-6e3f-410e-ae67-a6ed6af7ae53","year":2025},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:23.605270Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:cd7d561b234d41d4586b4a66957e097172d2000765c70d88adeda55b696af563","observation_id":"dcf12bee-54f8-4fc1-af21-d623e9e47cee","resolution":{"observed_at":"2026-08-05T14:29:32.213501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07482","last_updated":"2025-05-20T17:09:53Z","snapshot_observed_at":"2026-08-10T20:14:17.286416Z","submitted_at":"2025-01-13T16:58:32Z","title":"TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07482","snapshot_observed_at":"2026-08-05T14:29:23.670683Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:23.670683Z"},"links":{"cited_paper":"/paper/2501.07482","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:8fe221fe4a29a30addfe6404673e42b94a44b3b8d3826f4ead6b18924b70b3c1","observation_id":"24fa150b-aa88-4245-bd47-958f6ed0c259","resolution":{"observed_at":"2026-08-05T14:29:23.670683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:31.902653Z","title":null,"venue":null,"work_id":"6064844a-a216-483b-801d-8638c016c8c7","year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:23.718386Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:24dcfc450bd6f42a09ed8daf9f75ddf9ae1505e41150a0e08ea479e9fc7d44e7","observation_id":"9663f9b0-3247-4a90-90b9-b8b0345cbdb1","resolution":{"observed_at":"2026-08-05T14:29:32.010684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:23.790496Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:23.790496Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:240cabfc52ddff7a274759fdb8b951338d7280a7fe1214a91b0a9dd07aeaaf3a","observation_id":"3e82147f-4bd3-4cae-b040-e9f881a88828","resolution":{"observed_at":"2026-08-05T14:29:23.790496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00785","last_updated":"2024-04-13T22:02:23Z","snapshot_observed_at":"2026-08-04T16:19:28.848684Z","submitted_at":"2023-10-01T20:46:44Z","title":"BooookScore: A systematic exploration of book-length summarization in the era of LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00785","snapshot_observed_at":"2026-08-05T14:29:23.899222Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:23.899222Z"},"links":{"cited_paper":"/paper/2310.00785","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:b6eff2f6b80e3a0fba6395ee6119690c186b8876762a0bc96085386945041981","observation_id":"44bd195e-b96a-461d-b7b9-6759b346d877","resolution":{"observed_at":"2026-08-05T14:29:23.899222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T14:29:23.996201Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:23.996201Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:70e81149d134ab8d84d74b9312a028b3e58ec562945617a30acb7f1e69b62c26","observation_id":"42309746-4a0a-4a55-9921-8a5da921bfdd","resolution":{"observed_at":"2026-08-05T14:29:23.996201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:31.653555Z","title":null,"venue":null,"work_id":"e3c07f0f-5ca7-4507-90bf-c6d4d360b5cf","year":2025},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.148897Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:48cf14b887856a49bde9f9357ed3f25c2e914e68f6e2dc0eb0b59f944de82363","observation_id":"951889fe-8d21-4f1d-97e6-946498c00af7","resolution":{"observed_at":"2026-08-05T14:29:31.747665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:31.465628Z","title":null,"venue":null,"work_id":"13572ad5-be1e-4654-b4cf-167fe54ba76f","year":2017},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.264902Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:357d8a185df284db0f49f6041effd620b877369b20297d1db12789186a99b7b9","observation_id":"07d4e8ed-2649-4c00-bcae-31d71ab9143c","resolution":{"observed_at":"2026-08-05T14:29:31.532760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:31.233322Z","title":null,"venue":null,"work_id":"1a366606-6d6a-4b48-a602-9605861a4d4e","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.477316Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:e007825132fd9e3f313ae548bfb8bd35e7ca23c64c1399c30a05a8bae62dd65a","observation_id":"58b60776-da34-43c0-974a-ff4c8b8e401d","resolution":{"observed_at":"2026-08-05T14:29:31.352651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T14:29:24.599440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.599440Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:b5e19949ec99ad1535ea4b0332de94a8dc17f8625561bdadd36e165764f66c0e","observation_id":"fee5725b-56d5-4f96-a471-4647acdd7ea0","resolution":{"observed_at":"2026-08-05T14:29:24.599440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:30.988575Z","title":null,"venue":null,"work_id":"9085913d-0569-41f4-8876-39bb74299e6a","year":2021},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.685635Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:39e57b7831f4aa7bbc23e60b8d11c6d62629256de7aa6a9910782252afa14d1b","observation_id":"b44391a5-c878-4a37-ac0f-2056b803b79e","resolution":{"observed_at":"2026-08-05T14:29:31.121715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:30.771120Z","title":null,"venue":null,"work_id":"5f666c95-08b5-4e0d-b5d8-6672d264c0e8","year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.807406Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:b17e0e4d8f2f93892f4edcf2a1ab6ef76cd8ab4492c761474c875aef50747869","observation_id":"d51990f6-cc45-4989-8343-410928092da0","resolution":{"observed_at":"2026-08-05T14:29:30.867280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05115","last_updated":"2022-05-23T16:41:08Z","snapshot_observed_at":"2026-08-07T01:30:18.016560Z","submitted_at":"2022-03-10T02:24:14Z","title":"Internet-augmented language models through few-shot prompting for open-domain question answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05115","snapshot_observed_at":"2026-08-05T14:29:24.903191Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.903191Z"},"links":{"cited_paper":"/paper/2203.05115","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:58c233c8df0937febb2dcefa4a497e3289f8ddbae59de576ed1b7831405082dc","observation_id":"935a4d2f-bb3b-49f1-ba0f-a16d1982cffd","resolution":{"observed_at":"2026-08-05T14:29:24.903191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-05T14:29:24.990122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.990122Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:062f731510056a34cf4cf35a3da934145eff2e4a3efa93681b19d9e8c8fe4d6e","observation_id":"93a3a951-c912-49f2-8512-585b1fc62165","resolution":{"observed_at":"2026-08-05T14:29:24.990122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T14:29:25.055578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.055578Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:bf1d7f3956db28ee0e6ccebed7ae704dc34528ef952be80d74a187b525ce4412","observation_id":"4780e4ab-ffaa-4ee6-ba73-912d97c675f5","resolution":{"observed_at":"2026-08-05T14:29:25.055578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T14:29:25.185820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.185820Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:27796bb7a844cf41c49b1ca8601f531796aef7fc38f5b041c4a13caf771e1abe","observation_id":"01d3c3d1-f9cd-45ac-82ba-18aa1e098d33","resolution":{"observed_at":"2026-08-05T14:29:25.185820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:30.538329Z","title":null,"venue":null,"work_id":"804d0369-1554-4b8f-9727-1c4be288aceb","year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.249885Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:f244f1b419f9ed44f0f4a37a88440468a391765b259f5452a189d3805e003001","observation_id":"c7280c30-4170-40f1-98b8-be5e49d8d153","resolution":{"observed_at":"2026-08-05T14:29:30.645923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:30.296867Z","title":null,"venue":null,"work_id":"41f32a61-a805-417a-97a6-8de635a90667","year":null},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.386104Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:b1570d995cc5eb401dbb74770371870bd1d806e622740ca7ba0c58ebaacaf10f","observation_id":"71eb8cd8-a69d-447a-976e-097431e697eb","resolution":{"observed_at":"2026-08-05T14:29:30.430871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:30.112612Z","title":null,"venue":null,"work_id":"f0213bf4-0995-4a1d-9567-594e53b63827","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.499280Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:8ecf33272ae367dc3f1ddabe68665a69ed1ed54c9370ccb77002186bb565f050","observation_id":"6f903163-dfff-46e5-9bad-aa23a9dd113e","resolution":{"observed_at":"2026-08-05T14:29:30.190199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T14:29:25.573719Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.573719Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:484c769cf45b6a44de34d0da15d2780ed110eff4c1cfad04f33bc0bc54170340","observation_id":"3cec02dc-66bc-4961-a29d-e4dad189423e","resolution":{"observed_at":"2026-08-05T14:29:25.573719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:29.872476Z","title":null,"venue":null,"work_id":"ad1deba9-6b51-49cb-acda-64d7be21d2fd","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.636046Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:b1e3abc9f20101dcc76b45dd2ce95bceda41ad124cd15246c4ecb33c36a59bca","observation_id":"cd529a54-b03f-4cef-8e6c-7c4cbe205294","resolution":{"observed_at":"2026-08-05T14:29:29.972746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:29.596086Z","title":null,"venue":null,"work_id":"4ffa3dd0-3a83-4577-83ea-00b0fa19f26a","year":2022},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.698071Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:b6eb1bd4def9312bcb2f08f50a63f684558ca8e1f4c9480b95507bea2b0b41ca","observation_id":"19492d60-f88b-4e81-ae7a-5b4010f3842d","resolution":{"observed_at":"2026-08-05T14:29:29.726830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:29.323499Z","title":null,"venue":null,"work_id":"daf8cacc-2433-4e4d-b5af-346299028d1c","year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.753432Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:f03b503d3728292697deaf698e1b21f6a405fe1d7041f3d3ceb33f2004b7a11a","observation_id":"ffd4891e-57b0-4437-a863-66f2fd4f7694","resolution":{"observed_at":"2026-08-05T14:29:29.446504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01066","last_updated":"2019-09-04T09:33:20Z","snapshot_observed_at":"2026-07-06T08:18:37.267833Z","submitted_at":"2019-09-03T11:11:08Z","title":"Language Models as Knowledge Bases?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01066","snapshot_observed_at":"2026-08-05T14:29:25.831985Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.831985Z"},"links":{"cited_paper":"/paper/1909.01066","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:a0d24f15279e37491bc667dda76461d3dc9ea1bf69030c9a59a69c6f09e06b84","observation_id":"085d50f8-880a-4b32-b959-ce76cc86452b","resolution":{"observed_at":"2026-08-05T14:29:25.831985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:29.147432Z","title":null,"venue":null,"work_id":"a132793a-9b94-489a-9952-b9c98f4af21b","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.928673Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:9dfac6e2210751dd4870d063f2f85997cb5549ba4f4c44c93e833ab30ab3de1d","observation_id":"d86dc1a8-57e2-4845-9be3-e5be4400edbc","resolution":{"observed_at":"2026-08-05T14:29:29.204127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14169","last_updated":"2023-11-23T19:20:59Z","snapshot_observed_at":"2026-07-06T16:51:40.320710Z","submitted_at":"2023-11-23T19:20:59Z","title":"Evaluating GPT-4's Vision Capabilities on Brazilian University Admission Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14169","snapshot_observed_at":"2026-08-05T14:29:25.998514Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:25.998514Z"},"links":{"cited_paper":"/paper/2311.14169","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:114519d4e2b9d65595f938c4e665d61e1b1e281e05262d8eddd2054b55c34751","observation_id":"56159e6c-f5ad-45bd-96bb-c881728e2c3a","resolution":{"observed_at":"2026-08-05T14:29:25.998514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:28.908488Z","title":null,"venue":null,"work_id":"d8a5e3eb-79d5-4563-9a65-cc25afa8c571","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.060059Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:f8a0a27183f043252ec6688237a6e961888af0603a8f675fcc26119f854a85c7","observation_id":"a92078f3-dec0-4dda-b073-458d0b25f976","resolution":{"observed_at":"2026-08-05T14:29:29.006687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:28.696782Z","title":"Academic ranking of world universities 2024","venue":null,"work_id":"335a59e1-2964-4173-9313-e14fcf6bd641","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.114983Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:55f88400485aa539c4b73d81dd9300331705cc589a55964472161de56e7f8065","observation_id":"0615e96f-0961-4d51-b008-4e65029ce198","resolution":{"observed_at":"2026-08-05T14:29:28.811196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:28.547535Z","title":null,"venue":null,"work_id":"bdb02d37-4aa4-4337-98cc-5da9c15ef054","year":2017},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.209759Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:d068fad04e5f3a91a3fa9f12c7ec6cfb3be846bfddf24cd99a74beb278c92dc9","observation_id":"7ad7ee47-edfd-4100-96d4-88cf85b65d99","resolution":{"observed_at":"2026-08-05T14:29:28.629922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:28.334422Z","title":null,"venue":null,"work_id":"6939e4c3-dcb9-4eed-9200-a9c81a7c5bca","year":2025},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.285618Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:48fe7e5eea3b12f7e0b23a1aade7fa105527c861bebf33506f1d38ad7e65d29e","observation_id":"a2408da8-e8e9-4c3e-adba-b4d701ef561d","resolution":{"observed_at":"2026-08-05T14:29:28.443689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:28.111494Z","title":null,"venue":null,"work_id":"fef46844-db88-4255-a2b7-bf7c4132757b","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.343069Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:0cf594060321a01c960c4110103e58220828239e308868574124a575b90bed27","observation_id":"7a0af610-abfd-469b-b2dd-b4b45a7cacd5","resolution":{"observed_at":"2026-08-05T14:29:28.233929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:27.907508Z","title":"World university rankings 2024","venue":null,"work_id":"09630501-8228-4173-ac34-ba5110c9995c","year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.424913Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:57dc2175bf15977f4ef07b55f92928ea49656bc5e8190a9f5b5a5b6acad3f41b","observation_id":"10a347a7-3ecf-4c0e-a584-3190768bb7d3","resolution":{"observed_at":"2026-08-05T14:29:28.012094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T14:29:26.507800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.507800Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:2e2ae7e2013496a799de4478863480949b8d54e30cab9c659ea2a658cee87bcf","observation_id":"5eae67a5-2882-426d-8555-c3d780f89101","resolution":{"observed_at":"2026-08-05T14:29:26.507800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05510","last_updated":"2023-03-09T18:59:47Z","snapshot_observed_at":"2026-08-09T16:16:46.530132Z","submitted_at":"2023-03-09T18:59:47Z","title":"Planning with Large Language Models for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05510","snapshot_observed_at":"2026-08-05T14:29:26.568182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.568182Z"},"links":{"cited_paper":"/paper/2303.05510","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:6742095b79a856b49b155f570110f890ba34bb7b897084ef43924a9ab29b8b62","observation_id":"ee31c22d-fae6-4f86-91b1-7438f039009d","resolution":{"observed_at":"2026-08-05T14:29:26.568182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:27.761757Z","title":null,"venue":null,"work_id":"d2baf40a-5aab-4f9a-b910-6df569b4dc75","year":null},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.631064Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:79c046305935b349bf8ca8583fadf41cadaf984fd70a9812f8d3347e2571fd4d","observation_id":"b84d1c7f-205f-47ed-9a6f-bd222820771b","resolution":{"observed_at":"2026-08-05T14:29:27.859210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:26.699659Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.699659Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:2b2768aa6fbb9978fb7d51309bb60b8c6851c135bd9152fa04ee5d0a3995350e","observation_id":"91b489aa-024b-4890-aa27-188e25f3dae3","resolution":{"observed_at":"2026-08-05T14:29:26.699659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:27.543755Z","title":null,"venue":null,"work_id":"170b09d4-177a-4ae3-8138-a99650faaf3a","year":2023},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.754545Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:e9079881dccf98ca4417562f9309015f17400cb339ecb1983ce5aaaa14f59900","observation_id":"fd38d478-3f2d-4b52-a6a7-7b625bdc621c","resolution":{"observed_at":"2026-08-05T14:29:27.672013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:29:27.334195Z","title":"write newline","venue":null,"work_id":"bf89d49f-1a5e-4f1e-bea9-1802673f8d3b","year":null},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:26.820176Z"},"links":{"citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:eb469b602e4f6852c423cb87f507cc2c71691cee2ef196c3b9a5092590a96e19","observation_id":"8201dee9-1b77-479c-88b5-e41de6de0650","resolution":{"observed_at":"2026-08-05T14:29:27.392992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:04:25.436665Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2508.21294."}