{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68534edd4874dadf0e56598cd05b45027278beaa2e2e3ba9ea6ada73d9b58573","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:49:51.633826Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01274/citation-record","integrity":"/paper/2508.01274/integrity","json":"/paper/2508.01274/citation-record.json","paper":"/paper/2508.01274"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T05:49:51.471076Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.471076Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:fb6b624cb01c32c4dd982ccaccdba14a1f4bacefb3515216aa732ba511a2281b","observation_id":"dc5a86d8-dd3d-48ca-a4c8-8cc0eb4a778d","resolution":{"observed_at":"2026-08-06T05:49:51.471076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-06T05:49:51.476645Z","title":"Dai, Orhan Firat, Melvin Johnson, Dmitry Lepikhin, Alexandre Passos, Siamak Shakeri, Emanuel Taropa, Paige Bailey, Zhifeng Chen, Eric Chu, Jonathan H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.476645Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:d8c3fb1f35129f0eec19b209e8b88b44c31eea298429b38c1c70063d6506b236","observation_id":"7c3760e2-6b13-4238-9598-afa4c68ef494","resolution":{"observed_at":"2026-08-06T05:49:51.476645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T05:49:51.481291Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.481291Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:846bcd2494be24659d4bc55720917517c16321a0cf0e03c614bbb07cabc9a6ea","observation_id":"954b39b7-564b-4757-a8f4-c23729d4b035","resolution":{"observed_at":"2026-08-06T05:49:51.481291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T05:49:51.486412Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.486412Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:99755deb860a6bbeeb9801af25cebfa4525f905431b1272f252552f3e0fcabca","observation_id":"8478b6f7-e84a-480a-9064-26039c21df75","resolution":{"observed_at":"2026-08-06T05:49:51.486412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-02T01:30:06.675966Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-06T05:49:51.490677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.490677Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:2d1152f01280f063647a3542d3a7a16a158265afe0cbf4ee9648548f39bb32f0","observation_id":"fa26fd49-b609-4ebc-bc3f-caa9c3ce5658","resolution":{"observed_at":"2026-08-06T05:49:51.490677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.494989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.494989Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:0c531b9daa8b210296ab227fb92c004da937ab9d2706f777fa4e3ff00634f5d7","observation_id":"464b06ab-5ea6-4f0e-9008-c258dc984a71","resolution":{"observed_at":"2026-08-06T05:49:51.494989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T05:49:51.503929Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.503929Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:5a59f00406aab4c1ff87ec6e572246d39e26245146957d7540128271f3602fea","observation_id":"5f6d1483-0f00-4886-8580-df48b871d38b","resolution":{"observed_at":"2026-08-06T05:49:51.503929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08448","last_updated":"2023-10-02T15:22:42Z","snapshot_observed_at":"2026-08-07T01:19:23.831232Z","submitted_at":"2023-09-15T14:52:23Z","title":"Advancing the Evaluation of Traditional Chinese Language Models: Towards a Comprehensive Benchmark Suite","version":2},"cited_work":{"arxiv_id":"2309.08448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.08448","snapshot_observed_at":"2026-08-06T05:49:52.307252Z","title":"Advancing the Evaluation of Traditional Chinese Language Models: Towards a Comprehensive Benchmark Suite","venue":"cs.CL","work_id":"43247a11-5ee0-426a-baa2-a77c137b3457","year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.507893Z"},"links":{"cited_paper":"/paper/2309.08448","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:99ffa6a51eca3c1a90c31253a1a021aeca509a841a1aa51551f0be1fbf9963ca","observation_id":"2ca8ade5-cbda-499e-9b66-a7fee0937720","resolution":{"observed_at":"2026-08-06T05:49:52.312171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00127","last_updated":"2023-12-30T03:19:54Z","snapshot_observed_at":"2026-08-06T18:18:39.214227Z","submitted_at":"2023-12-30T03:19:54Z","title":"Pushing Boundaries: Exploring Zero Shot Object Classification with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2401.00127","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00127","snapshot_observed_at":"2026-08-06T05:49:52.290598Z","title":"Pushing Boundaries: Exploring Zero Shot Object Classification with Large Multimodal Models","venue":"cs.CV","work_id":"f6280bd7-8a70-4a3c-b260-01a5ca2d8572","year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.511885Z"},"links":{"cited_paper":"/paper/2401.00127","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:98071f98f2d0f3e19d82427885c534b348a4b7ad61efefc810fbb13879fb6223","observation_id":"9abc9593-2302-40ae-9e90-8a2a30723b4a","resolution":{"observed_at":"2026-08-06T05:49:52.295911Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12792","last_updated":"2023-09-22T01:44:46Z","snapshot_observed_at":"2026-08-04T07:24:03.964437Z","submitted_at":"2023-08-24T13:47:16Z","title":"Sparks of Large Audio Models: A Survey and Outlook","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12792","snapshot_observed_at":"2026-08-06T05:49:51.515683Z","title":"Schuller","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.515683Z"},"links":{"cited_paper":"/paper/2308.12792","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:a8972a880790a2bd01d094cbda1a065fa70e7ab56da45983b71927bece4ecf73","observation_id":"52fed0d3-eb66-4725-b249-4535076df960","resolution":{"observed_at":"2026-08-06T05:49:51.515683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T05:49:51.519985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.519985Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:62f7b30baee8d82a891f5de4ce8208df13d2f49fb18bab5844d60ef105d92ec6","observation_id":"94c8b40b-c7d3-4a27-8637-b0d0cda626e3","resolution":{"observed_at":"2026-08-06T05:49:51.519985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.523705Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.523705Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:1a7bd83c8a6d952b5d7ec62e71dc273f2cd04d469a787f981c341afbdf44b864","observation_id":"4443a859-1e0a-4085-b415-398d5bf08a6e","resolution":{"observed_at":"2026-08-06T05:49:51.523705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.527589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.527589Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:e34df5d04070c64834401586b4424462bd4c0e7b8a039d0131bc1d851e09818c","observation_id":"9dc37bcf-276c-4b5d-8840-87b530acbf19","resolution":{"observed_at":"2026-08-06T05:49:51.527589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-06T05:49:51.532048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.532048Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:c792a92a66cd15accbb2f2b15f5d682b22251e1376a17ee8e0b793ec736d1207","observation_id":"0e151fc7-433a-4cbe-a98c-fea04d225d58","resolution":{"observed_at":"2026-08-06T05:49:51.532048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2758.36728","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:52.123656Z","title":null,"venue":null,"work_id":"cc79a564-c5cb-46d9-ae1d-540dcfba1f9e","year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.537137Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:c4847e339595b4f95c6144bfef24ea786f0715af3b66e69a663a31980c9f0c9a","observation_id":"c0061773-5485-4a23-ac3d-f3f2e8d5b07e","resolution":{"observed_at":"2026-08-06T05:49:52.129584Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T05:49:51.541245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.541245Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:b2f52d948c1bcfb1e1894f2f17f677ee50eb1b18a78207d4a25b5de0e254f31e","observation_id":"f850a393-35f4-4544-9e8d-3016414b342a","resolution":{"observed_at":"2026-08-06T05:49:51.541245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-01T22:57:31.468506Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-06T05:49:51.545721Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.545721Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:005ebabe75468aea5fae79eb160c856e41ad22fcd5d80c81c11c8f792f7a6431","observation_id":"2e351de5-1f16-41ee-ba07-365d0832fabb","resolution":{"observed_at":"2026-08-06T05:49:51.545721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:52.410227Z","title":null,"venue":null,"work_id":"1f804496-388c-43bb-8e05-431291067ffe","year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.549680Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:1590c01b334db95bac0ce002740dcd30571f7fac0081cea79a3443d3f0f87249","observation_id":"8e47b658-d696-4523-b3dd-705168a89a24","resolution":{"observed_at":"2026-08-06T05:49:52.413724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.553420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.553420Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:d2b0d61380ff431b9687ddd76114b3e9c187cb14edb7fce3dce0a93adc688528","observation_id":"b60a8aef-585f-46c8-b57e-7e0c20c69c0d","resolution":{"observed_at":"2026-08-06T05:49:51.553420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-06T05:49:51.557351Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.557351Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:1b3a804c66627c186310b08c3278885abef6078aeb01aa816df6c74a7087ebdf","observation_id":"781239df-d54f-4db6-a466-e88b33e7efd7","resolution":{"observed_at":"2026-08-06T05:49:51.557351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T05:49:51.561890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.561890Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:6755e7b3517c1a9992d51d382ad202c4b150ea1d1417d0fe5d319f1febb48b2d","observation_id":"951980de-f011-4bca-999e-e6bf5f847499","resolution":{"observed_at":"2026-08-06T05:49:51.561890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T05:49:51.565299Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.565299Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:bf67513cc150f574a849608341b7dac6c8ab59aef570b8cc206d6e7f20054148","observation_id":"4156e41e-bcd0-4c2d-a4d1-341cb8b40ca1","resolution":{"observed_at":"2026-08-06T05:49:51.565299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T05:49:51.570094Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.570094Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:3ba66e4b0308330782366f1be511c610392da90f500fc505ad74397f805b2e44","observation_id":"2726712a-3e7d-4f50-8701-4b8e4e9825d3","resolution":{"observed_at":"2026-08-06T05:49:51.570094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-06T05:49:51.574197Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.574197Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:703360853ddc625874f140b713fbdbfb5ea895a9cb8a0e53bc04143e50d099b7","observation_id":"512dc07b-01b1-40b9-8aec-f52d171a6f9d","resolution":{"observed_at":"2026-08-06T05:49:51.574197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-06T05:49:51.577941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.577941Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:66b2143585be84e6d180e28029462b0944c6b08766c064a9df41b0b0419b940c","observation_id":"baf34838-8818-4543-9f52-90c9110f8a37","resolution":{"observed_at":"2026-08-06T05:49:51.577941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01858","last_updated":"2024-07-11T14:41:14Z","snapshot_observed_at":"2026-07-06T17:39:03.755444Z","submitted_at":"2024-03-04T09:13:33Z","title":"An Improved Traditional Chinese Evaluation Suite for Foundation Model","version":3},"cited_work":{"arxiv_id":"2403.01858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01858","snapshot_observed_at":"2026-08-06T05:49:51.887967Z","title":"An Improved Traditional Chinese Evaluation Suite for Foundation Model","venue":"cs.CL","work_id":"7f4fa836-be04-4a9c-91a4-e341ac7fa138","year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.582399Z"},"links":{"cited_paper":"/paper/2403.01858","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:82c4328e1a77b9f302033f2c26f180e0b2754468bf987ef790416203135ab8c1","observation_id":"78135712-2999-478e-b7f1-745c2641a127","resolution":{"observed_at":"2026-08-06T05:49:51.893428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10427","last_updated":"2025-03-15T01:32:58Z","snapshot_observed_at":"2026-08-07T17:06:52.627924Z","submitted_at":"2025-03-13T14:49:35Z","title":"VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan","version":2},"cited_work":{"arxiv_id":"2503.10427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10427","snapshot_observed_at":"2026-08-06T05:49:51.869072Z","title":"VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan","venue":"cs.CL","work_id":"a8985cf7-b94a-49ad-b9d4-3f8900730edb","year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.586304Z"},"links":{"cited_paper":"/paper/2503.10427","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:823b519ff9423ce8325f7e306c180ec22818c9dd2dbea9c135c513198fa1815c","observation_id":"22ba5860-1755-499a-b8e8-de9e7eb105d0","resolution":{"observed_at":"2026-08-06T05:49:51.875346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:51.590032Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.590032Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:3cebdbb13d1d8faf86d130093644e759713e01fb8ee5b4dffa92d09b8bbe710f","observation_id":"b1c98d8c-6bf4-4c85-8212-e1339376e2aa","resolution":{"observed_at":"2026-08-06T05:49:51.590032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T05:49:51.593351Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.593351Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:5c4ee6257646a4e7424825aedd59649e2471eb65c42b13d4417ab35e865905ae","observation_id":"cfd6b74b-d94d-4395-a69f-30d8ace9b657","resolution":{"observed_at":"2026-08-06T05:49:51.593351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T05:49:51.597318Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.597318Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:e8671c7ebb6409037399f0fbc43f9a93b559ae51fd5604a6f7d1faaf632cd0e3","observation_id":"ca80e7d3-91fb-4d44-af98-966e19321006","resolution":{"observed_at":"2026-08-06T05:49:51.597318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:49:52.390677Z","title":null,"venue":null,"work_id":"a179d837-27d4-45e6-8506-3b4b4a6369ea","year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.601137Z"},"links":{"citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:af261ee125ce38a0bf83ec260a0e61d254d917ef1b751c3f12623853ac9a5bea","observation_id":"7901e85c-568a-4313-bff0-1ac5f285c8a9","resolution":{"observed_at":"2026-08-06T05:49:52.394377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T05:49:51.608775Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.608775Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:6dcadff92f96b56a2a1af589e0dcddad83279fedde00fb01fdb5f0781222bfca","observation_id":"9d6818eb-e463-4cf5-8a03-e44237d8a785","resolution":{"observed_at":"2026-08-06T05:49:51.608775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T05:49:51.612343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.612343Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:e0ed1a84714ba496ed062c0534076e034dae01bd7088fdf012c178c559fdfdf1","observation_id":"c471a939-5148-4b67-b08c-e653c1b02032","resolution":{"observed_at":"2026-08-06T05:49:51.612343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-07-06T10:07:22.052360Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-06T05:49:51.616635Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.616635Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:9b212fecafad55ffed536cac36aa00052405f6bfe3d77a53e921cc85a61b622b","observation_id":"ad72b08f-cd06-409b-a456-7baf9d73d505","resolution":{"observed_at":"2026-08-06T05:49:51.616635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T05:49:51.620971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.620971Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:03d28836485585e37884c8c604636fedcd36fe8e653b1d35160c595d9b911caa","observation_id":"5f25729c-21ce-41dc-8e41-ff2e4d09c075","resolution":{"observed_at":"2026-08-06T05:49:51.620971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T05:49:51.625753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.625753Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:867d4cd1bd0d70c7ac1cc261c640ebadbe22cc1dd3f6280b8422931c9c54f8e7","observation_id":"e4a42ff3-5375-46fa-859f-e25a3a93e91e","resolution":{"observed_at":"2026-08-06T05:49:51.625753Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-06T05:49:51.629751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.629751Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:a193cb731ca08cd73337e4898b3375a39b2985cdf3ffa51385d741fb18fd243a","observation_id":"e19c2b0d-7237-4140-a787-c1e5cbbf9be9","resolution":{"observed_at":"2026-08-06T05:49:51.629751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-06T05:49:51.633826Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.633826Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:3a892f37a3e13dbe44c03892c25c9f3b949455a2525e0b4504b42b44cefbc5af","observation_id":"980b3d77-fb56-4d2b-95f1-4a89297c6834","resolution":{"observed_at":"2026-08-06T05:49:51.633826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T05:49:51.499143Z","title":"arXiv:2407.10759 [eess.AS] https://arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.499143Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:8df882db9a1ec70506cdf5e3d08e1c94c5934f79a3ebcf1d8a635d263fee8ca2","observation_id":"99981462-a7fa-4aac-9aa8-99338b81a894","resolution":{"observed_at":"2026-08-06T05:49:51.499143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16508","last_updated":"2025-05-01T03:41:42Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T15:44:42Z","title":"All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16508","snapshot_observed_at":"2026-08-06T05:49:51.605060Z","title":"arXiv:2411.16508 [cs.CV] https://arxiv.org/abs/2411.16508","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.605060Z"},"links":{"cited_paper":"/paper/2411.16508","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:eb8d55bee74671e3e48816ea4767e63fca14a93493910642e373108a8e9fb19f","observation_id":"518f67d6-ad7f-485a-9f1a-34a293fbc990","resolution":{"observed_at":"2026-08-06T05:49:51.605060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":34,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2508.01274."}