{"as_of":"2026-08-08T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09fb35bb9455f8263d843cb4d154212fa0c9b349b911de42290482a02cb0953f","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:35:36.773332Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.14505/citation-record","integrity":"/paper/2505.14505/integrity","json":"/paper/2505.14505/citation-record.json","paper":"/paper/2505.14505"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:35:34.126173Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.126173Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:3c42af423769ec7434012009ff12eaaecf9b1f25c1210a38af3324616222230f","observation_id":"b546717e-ca45-4bcd-aad1-ab69ef9020d6","resolution":{"observed_at":"2026-08-07T15:35:34.126173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10393","last_updated":"2024-11-11T04:48:24Z","snapshot_observed_at":"2026-08-02T22:32:18.440244Z","submitted_at":"2024-10-14T11:29:38Z","title":"GIFT-Eval: A Benchmark For General Time Series Forecasting Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10393","snapshot_observed_at":"2026-08-07T15:35:34.216986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.216986Z"},"links":{"cited_paper":"/paper/2410.10393","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:05efdd634631872e9de7f24a3b6a5c852fcbc5682a07fcb0320e4be23b7cbefc","observation_id":"66fbd247-4f4a-4426-9aa7-f660f41a03fd","resolution":{"observed_at":"2026-08-07T15:35:34.216986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.05522","last_updated":"2017-09-16T14:33:27Z","snapshot_observed_at":"2026-08-08T03:22:44.188296Z","submitted_at":"2017-09-16T14:33:27Z","title":"AISHELL-1: An Open-Source Mandarin Speech Corpus and A Speech Recognition Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.05522","snapshot_observed_at":"2026-08-07T15:35:34.287638Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.287638Z"},"links":{"cited_paper":"/paper/1709.05522","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:9de3c9cc6201aad637e077687e0e20cdaf7273bc83dbae5f19a7ccb5cd37d9f0","observation_id":"aaf3b6e6-43e1-4be0-b3cf-23b4959b8af4","resolution":{"observed_at":"2026-08-07T15:35:34.287638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:34.359274Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.359274Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:1eb7f02af98bc4ef253ea6eecc8dd84379427d1664f74d9a40b3cbf41b3d9b05","observation_id":"a56d8b10-f90f-478d-af02-3109d9e3aeda","resolution":{"observed_at":"2026-08-07T15:35:34.359274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-07T15:35:34.436672Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.436672Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:9e459d6923d37a37deaddd8b6780b9ba7ba7b3c7be6caf6ad9b85a532bbe30ca","observation_id":"68a292bd-7419-452b-bf2c-153bb6cd0355","resolution":{"observed_at":"2026-08-07T15:35:34.436672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T15:35:34.547184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.547184Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:c8d35a010f17072825af36ff34453e1261f8bf88601b575185af364e8bc7e876","observation_id":"026308a5-89d4-4120-a288-666b60c7ada6","resolution":{"observed_at":"2026-08-07T15:35:34.547184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:35:34.644120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.644120Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:84ba5d6f3ead14e6e87dd36c415f8e948efedb5aaf671150034b73d62d8a0083","observation_id":"180b0dc2-a501-411a-aaf2-b27ae8112244","resolution":{"observed_at":"2026-08-07T15:35:34.644120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:37.883243Z","title":null,"venue":null,"work_id":"5eeb6182-938b-410a-a9e0-32b8d37e50fb","year":2017},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.682440Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:17a25f583587d565b683576072aef2f619c5f4178c72042da0e5ecbdbb16203c","observation_id":"86587d0c-b4a8-469a-8ce9-f18d85ca108f","resolution":{"observed_at":"2026-08-07T15:35:37.910028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T15:35:34.824926Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.824926Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:be6d7736ba0026ffc4cc8f62e00416b0bc4cd56fb70de0d1fdfc419577b31d23","observation_id":"95732f85-aeac-46e7-89c7-635d81b40959","resolution":{"observed_at":"2026-08-07T15:35:34.824926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:37.731021Z","title":"Hudson and Christopher D","venue":null,"work_id":"fa182e2d-442c-41f7-8c69-afa5b5d6421b","year":2019},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.901043Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:cf0108b8f464554e3a5b522161c0a900a71fc7f740280f1964ad3d3ba9f5fb89","observation_id":"e5727c08-58ed-4622-97b9-84fe7113640f","resolution":{"observed_at":"2026-08-07T15:35:37.813500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:37.656776Z","title":null,"venue":null,"work_id":"96606afe-9f99-4ec0-9b3f-de1795df02d0","year":2023},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.952880Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:3fbc94f27dc13bf7b50999841f5b7e1e7b42190e0197d193ea9e73500d75c761","observation_id":"b988c5e1-457a-475b-9319-7ed9de739c1e","resolution":{"observed_at":"2026-08-07T15:35:37.688259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T15:35:35.001638Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.001638Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:dfd3ce7e4abc28bb596d9d4359abfb8d6c7502068a60d2f0ffc6f5c425e8510c","observation_id":"68e29713-22c3-4a41-ae97-812550c7d3bb","resolution":{"observed_at":"2026-08-07T15:35:35.001638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T15:35:35.068537Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.068537Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:d7a89b096aae92c9052c8846f84935d0859cb07d638c22bc8cc84c1b144934a6","observation_id":"66f5a789-2b62-4282-a8dc-d9ed01b62343","resolution":{"observed_at":"2026-08-07T15:35:35.068537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02368","last_updated":"2024-10-18T03:19:55Z","snapshot_observed_at":"2026-08-07T22:33:25.182096Z","submitted_at":"2024-02-04T06:55:55Z","title":"Timer: Generative Pre-trained Transformers Are Large Time Series Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02368","snapshot_observed_at":"2026-08-07T15:35:35.102882Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.102882Z"},"links":{"cited_paper":"/paper/2402.02368","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:740db3d383f9a02237f8ea1d82aaccf38765f3ff767bb5f1a7e56bee3144c5b0","observation_id":"ff220dcf-3e84-4379-b56a-e4d24a4a7a77","resolution":{"observed_at":"2026-08-07T15:35:35.102882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T15:35:35.218235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.218235Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:2bed46e41da37c2b195fd7d67fa84801ba7c8101c312253849f2dba43fb546ab","observation_id":"45b8986b-d5e7-411d-aefe-7caad2c70782","resolution":{"observed_at":"2026-08-07T15:35:35.218235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-07T15:35:35.273568Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.273568Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:11d0ad5ab3009fed6d922b3a02f763917c6077766c7f855006d7849e2ccfdb57","observation_id":"dad9cf08-4adc-4f1c-bbdd-c7d0208045e7","resolution":{"observed_at":"2026-08-07T15:35:35.273568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T15:35:35.359733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.359733Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:bd1c47ca456a4d01e8187c12133ae241f5977ee42c6f1992600babde8a11e573","observation_id":"e8b66aed-7666-4ed9-9aa0-81844d3afe77","resolution":{"observed_at":"2026-08-07T15:35:35.359733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:35.407445Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.407445Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:eec9a30a641fca91bb80ad0915fcf81f570ab2dca0f05af79ad6117d6b031b14","observation_id":"5acbf1af-5252-4cb4-b22b-84b7c0dd8907","resolution":{"observed_at":"2026-08-07T15:35:35.407445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-08-07T16:54:15.957609Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-07T15:35:35.454816Z","title":"Wind, Tianyi Wu, Daniel Wuttke, and Christian Zhou-Zheng","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.454816Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:b227ce86da7ba7b9128271ad4bf2780397cd7e6d519bdd941ba2100f8416f090","observation_id":"c385da79-6aec-4424-a7ce-7bd55bfc5b77","resolution":{"observed_at":"2026-08-07T15:35:35.454816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-07-06T17:47:42.867147Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-07T15:35:35.516406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.516406Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:5e2a55492f6bed8eb59cc1e3394bbeb440be594923081a76851dda904e2497e0","observation_id":"fcd07736-4447-44c9-a2d1-1e776e13e048","resolution":{"observed_at":"2026-08-07T15:35:35.516406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20150","last_updated":"2025-08-18T05:01:29Z","snapshot_observed_at":"2026-08-05T03:15:49.797401Z","submitted_at":"2024-03-29T12:37:57Z","title":"TFB: Towards Comprehensive and Fair Benchmarking of Time Series Forecasting Methods","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20150","snapshot_observed_at":"2026-08-07T15:35:35.607876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.607876Z"},"links":{"cited_paper":"/paper/2403.20150","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:b508f3b14c2eff7c4922efaacdafc6a4e75fdebd634fac9b7451ff1e94e90937","observation_id":"435ba784-5698-40cc-83aa-244e67889b97","resolution":{"observed_at":"2026-08-07T15:35:35.607876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T15:35:35.651289Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.651289Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:1245b0035bc47b43ff0fec41c1742e8f3a12960845763afd4e61567f7016ffeb","observation_id":"a8055a95-4747-40b5-aa74-3395dde6e504","resolution":{"observed_at":"2026-08-07T15:35:35.651289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T15:35:35.723258Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.723258Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:e320efd327da90b7f26338ea9337a05b9574e0d39090dc0649cb41f31e4017a7","observation_id":"cf7e1600-435f-49ed-9a59-da803e35217e","resolution":{"observed_at":"2026-08-07T15:35:35.723258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:37.492082Z","title":null,"venue":null,"work_id":"674ea17f-935f-4877-8d25-3d74ea4bee01","year":2020},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.778808Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:e9b2bfc76e51f3107c18e69a2e0565dd8df01b0097f72a26f89cbcf225717a46","observation_id":"4c1dd459-c6c3-4cf6-8903-cfb0dd1c477c","resolution":{"observed_at":"2026-08-07T15:35:37.539494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:37.340403Z","title":null,"venue":null,"work_id":"2e78038f-4b68-4201-a080-731467cf206b","year":2019},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.813739Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:1654e6546d94a7c5d2b33b92f771cca62e65150fc9580422a06051487ccc81d3","observation_id":"a1b88adf-195c-48af-a715-b2060f449af2","resolution":{"observed_at":"2026-08-07T15:35:37.428196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:35:35.930937Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:35.930937Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:bdeeba5aa9f341002396a54f2d8416ed964e99306259686d80cc19d45a45231d","observation_id":"c9d84ef3-4007-4177-a1ea-59000541265d","resolution":{"observed_at":"2026-08-07T15:35:35.930937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T15:35:36.086113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.086113Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:e9e2c28e2c229dbb19c2c6608e7a6ffaee3e6b3a03f29e9d84fb5319b52fd5c2","observation_id":"cf5cd08a-3d53-4918-a8d4-7d0a897fd5dd","resolution":{"observed_at":"2026-08-07T15:35:36.086113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T15:35:36.141592Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.141592Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:145624729c7ec321d03a644ebde3aa2d02eb260223fa6f67d8961c2a4798ded1","observation_id":"b631993f-1a1e-4a52-b85e-ca91850650a3","resolution":{"observed_at":"2026-08-07T15:35:36.141592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T15:35:36.181136Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.181136Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:b586c071bf50772d395a5c29581d1d3150ef56b0c1bcfd9553ab4d23f7c0ee4b","observation_id":"e8b704b2-7307-4d79-a53b-a6c2869b8dac","resolution":{"observed_at":"2026-08-07T15:35:36.181136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T15:35:36.276021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.276021Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:b7a1598acb485629677dbb0690442ce082c8234df8a0146b36392e5a990ccc05","observation_id":"dd249c0d-5472-4044-b85e-3abf2164512f","resolution":{"observed_at":"2026-08-07T15:35:36.276021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T15:35:36.402647Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.402647Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:3dd38336a8fbb2f73b46493cdf9fa59652987a040b9a0a9dafde64f71a2b5af6","observation_id":"18f01554-4540-4ce8-be3f-b9fbe424a5b2","resolution":{"observed_at":"2026-08-07T15:35:36.402647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04779","last_updated":"2024-02-07T12:01:02Z","snapshot_observed_at":"2026-08-01T20:40:21.545860Z","submitted_at":"2024-02-07T12:01:02Z","title":"StableMask: Refining Causal Masking in Decoder-only Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04779","snapshot_observed_at":"2026-08-07T15:35:36.506938Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.506938Z"},"links":{"cited_paper":"/paper/2402.04779","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:76de9d9b117feb1827731b94fd97c3a0f7464662f771f4c3af7ed1deef54dd47","observation_id":"4ea73cad-5d08-4c8d-8e82-edd91e5c2160","resolution":{"observed_at":"2026-08-07T15:35:36.506938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T15:35:36.589234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.589234Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:06ff42595a660acdc65b4133387ce5cecb9466d5a735e7fabaf1b2964ce943dc","observation_id":"3b34e047-9039-40f4-8926-623e91f137d6","resolution":{"observed_at":"2026-08-07T15:35:36.589234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:36.624042Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.624042Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:e18ceabc9366a810b72e59ad0192805bfedcc932b290e72a67acc711cc2cd22d","observation_id":"cd5e4df2-1903-40a5-8390-1f4227da5100","resolution":{"observed_at":"2026-08-07T15:35:36.624042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:35:36.773332Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.773332Z"},"links":{"citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:5df1ef77cd26723cb2e6e93550640bb71f8481650b30cc23e2d27255300ad2c7","observation_id":"4620b2ad-f0f8-4949-82dd-7dd0621115f8","resolution":{"observed_at":"2026-08-07T15:35:36.773332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2505.14505."}