{"as_of":"2026-08-23T08:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6fb793ae9d1e5af47d298ab5b9d19a4db751ad9adfc9db175d8edb138bb8562","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:16:44.559080Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T21:13:41.362773Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T21:16:51.304458Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"cited_work":{"arxiv_id":"2505.15755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15755","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.15755 (2025)","venue":null,"work_id":"4d7e2c9e-70e3-4b6a-b8eb-69e8fef024dc","year":2025},"citing_paper":{"arxiv_id":"2508.18187","last_updated":"2026-04-13T21:17:05Z","snapshot_observed_at":"2026-07-06T22:18:21.877811Z","submitted_at":"2025-08-25T16:44:43Z","title":"BRAIN: Bias-Mitigation Continual Learning Approach to Vision-Brain Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T21:13:41.362773Z"},"links":{"cited_paper":"/paper/2505.15755","citing_paper":"/paper/2508.18187"},"observation_digest":"sha256:a13abbe948b9ab59ea58521c17a8a837a49bef83ddd15e40b9262d7915ac3781","observation_id":"5c1aa832-789d-4219-b8f2-ca7a3a3890a2","resolution":{"observed_at":"2026-05-18T21:16:51.306848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15755/citation-record","integrity":"/paper/2505.15755/integrity","json":"/paper/2505.15755/citation-record.json","paper":"/paper/2505.15755"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:16:39.121046Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.121046Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:3d358602748329851bd1ebc255c0b1fb6e88b32c1d21c7f708684bf48d428f7a","observation_id":"388e3681-7b31-489e-a6a3-610181a59373","resolution":{"observed_at":"2026-08-07T15:16:39.121046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:54.852825Z","title":"A massive 7t fmri dataset to bridge cognitive neuroscience and artificial intelligence.Nature neuroscience, 25(1):116–126, 2022","venue":null,"work_id":"3fe5502b-fc65-4483-925e-d18a68396513","year":2022},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.175887Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:606316a1e735b022934f57cbdcfb383b70dbd3873261dbebed2f3ce2639715ab","observation_id":"0a1f4fdf-84b8-45fe-88f8-68b67d0d0d6b","resolution":{"observed_at":"2026-08-07T15:16:54.955379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:54.648308Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"7a29ad3f-92a7-4c76-b853-bea293c0e9b8","year":2016},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.215937Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:66f186d800242f479193db9751e94ced8faf68b5a704ea18393cd48041fb781e","observation_id":"b27846bb-acfb-49d7-907e-56fed05c6f3e","resolution":{"observed_at":"2026-08-07T15:16:54.736347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:39.318179Z","title":"Leo: Boosting mixture of vision encoders for multimodal large language models.arXiv preprint arXiv:2501.06986, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.318179Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:687caccaffd576192b3b490c782f755b28a52b03ddba5a9045aebfb632627f05","observation_id":"14313ba6-2bac-416d-801c-64b0818819fd","resolution":{"observed_at":"2026-08-07T15:16:39.318179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T15:16:39.427338Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.427338Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:497bc826e4e0bcce30606f66d9c1dce2ede17c2858ce955b9660eb4ebed18aaf","observation_id":"5c742277-b718-42fd-8e3c-5f465a930335","resolution":{"observed_at":"2026-08-07T15:16:39.427338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:54.444100Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"a0c952b0-7987-4d2d-863a-700f4de534b2","year":2005},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.527524Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:83f6da7d4072c45e865b01c4ce3663476666b7104a65e3588fe87661e9677cc0","observation_id":"a33319b0-cd3d-4002-b85a-5eee5ada4081","resolution":{"observed_at":"2026-08-07T15:16:54.522685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:54.352455Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"c092c8f7-aaec-42c2-9e89-10492ab77a34","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.643607Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:4c7818dd5d9e161e3cfe91bef8c899779fa54355885b6249793bd322eb0ca911","observation_id":"0728e3c3-fea1-4186-9749-da08669ceddc","resolution":{"observed_at":"2026-08-07T15:16:54.394220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:54.190303Z","title":"Matryoshka multimodal models","venue":null,"work_id":"4feefd74-f28a-4534-8fab-3821a96ca9c4","year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.726607Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:f307172e8cebcf272704fbab83a613dcf2177873925dc8ef55a49e8806ecdeb6","observation_id":"86606b4c-4ec8-45d0-a58d-675569d137c4","resolution":{"observed_at":"2026-08-07T15:16:54.286249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T15:16:39.782659Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.782659Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:38821b9c9215181211035277650d15eed7385af6b7f298032adf7b951c7bc6eb","observation_id":"1f8a7a84-6517-4757-a1a2-7c86839b3320","resolution":{"observed_at":"2026-08-07T15:16:39.782659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:54.050302Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"f51a00d7-d8aa-4791-9ec6-bb8f5dc8e28a","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.879597Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:1b000cab19e154c1d8b8c84fb8a935fd400d89f7f6aa0a4c338be3114277a5d4","observation_id":"d6e973b4-5e26-406e-85ca-985572024c10","resolution":{"observed_at":"2026-08-07T15:16:54.104757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01426","last_updated":"2025-06-15T21:53:18Z","snapshot_observed_at":"2026-08-16T02:31:53.306179Z","submitted_at":"2025-01-02T18:59:45Z","title":"Unifying Specialized Visual Encoders for Video Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01426","snapshot_observed_at":"2026-08-07T15:16:39.968294Z","title":"Unifying specialized visual encoders for video language models.arXiv preprint arXiv:2501.01426, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:39.968294Z"},"links":{"cited_paper":"/paper/2501.01426","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:3511ad34ee947f2a8cbd8677f584e1bad0f1138807b0afc062edfb8b9b8ec86d","observation_id":"332b05ac-8d32-4eff-9e6b-8312a4a097bc","resolution":{"observed_at":"2026-08-07T15:16:39.968294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:53.963921Z","title":"Stimulus-selective properties of inferior temporal neurons in the macaque.Journal of Neuroscience, 4(8):2051–2062, 1984","venue":null,"work_id":"670204b9-867f-420d-b705-1bcbbff51c7b","year":1984},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.111400Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:af938691c03bbb94ce8f67b11a7cbfa318889376d187aee04221a83341a9c872","observation_id":"a0833825-e0ea-4391-af46-3cd30e241cc9","resolution":{"observed_at":"2026-08-07T15:16:53.997039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-08-20T01:13:22.133159Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T15:16:40.200691Z","title":"Benchmarking and improving detail image caption.arXiv preprint arXiv:2405.19092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.200691Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:00f6136d743773e41ec6961a17c90f279a7a90c2b7c10f99eda699caa798eeea","observation_id":"60695a16-2667-4633-927a-546143c50a99","resolution":{"observed_at":"2026-08-07T15:16:40.200691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:53.787003Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"fa07d00e-a9a6-4873-a689-abbc7d4f1f52","year":2021},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.310420Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:1a075208fbf7d09972c7e998526430abacb8290dda2aabc1e3ccb470ed7d4294","observation_id":"de2d61fa-de9a-46af-82fc-18461c90b123","resolution":{"observed_at":"2026-08-07T15:16:53.883272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:53.551318Z","title":"EV A: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"d45080b1-45ec-4450-9e78-63b2b9631a8c","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.362527Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:cfc885f3f019b0b8f6f11721f3224d0c7adde7178925346b7d8dc07a38ec821e","observation_id":"58b7263b-a11f-41c7-9296-c36648d6e9b5","resolution":{"observed_at":"2026-08-07T15:16:53.659796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:53.365218Z","title":"EV A-02: A visual representation for neon genesis.Image and Vision Computing, 2024","venue":null,"work_id":"c6ab6a80-e6e2-4348-81c4-ecf437621de1","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.473232Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:070803ee1979be748895b77ea9d5b7c5f0cc31c26514e721edefce8a8e131086","observation_id":"c15c161f-5483-4191-bd26-441478c74ed0","resolution":{"observed_at":"2026-08-07T15:16:53.451823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11560","last_updated":"2023-05-19T09:57:19Z","snapshot_observed_at":"2026-08-20T06:36:27.925857Z","submitted_at":"2023-05-19T09:57:19Z","title":"Brain Captioning: Decoding human brain activity into images and text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11560","snapshot_observed_at":"2026-08-07T15:16:40.581833Z","title":"Brain captioning: Decoding human brain activity into images and text.arXiv preprint arXiv:2305.11560, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.581833Z"},"links":{"cited_paper":"/paper/2305.11560","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:ab2577937f2ae59ef7dab9f34a80b63afd7d1cddd92e92b44da91248c78cba3e","observation_id":"fea478de-afc1-4a5c-9c97-f23bdc2b1ed1","resolution":{"observed_at":"2026-08-07T15:16:40.581833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:53.094765Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":"5d7ece0f-fe27-48f3-a28e-7bf17b73af10","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.684760Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:6e5365dbd67c6865434e49fd28ec5fd68e4b20357883e4f35d055529f3bde4d5","observation_id":"1deedd2f-8eb3-4647-b7ef-6e1d7af3aa23","resolution":{"observed_at":"2026-08-07T15:16:53.223410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:52.823050Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"52949536-dde5-4130-9cff-576d9c66e4cb","year":null},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.762389Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:f29147da266c471be0d5d5f42bad7859d5256885a65005d132c4b280a8b37624","observation_id":"28a720fd-e4cf-43f3-a748-8861f3d6a1bd","resolution":{"observed_at":"2026-08-07T15:16:52.954101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:52.607293Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"7256209a-bf09-41d2-b41d-5bf59dc512c6","year":2022},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.795863Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:3b6bdfb8328c5c850459665bf778a203b705083897eccae14983f6a9e40a6e31","observation_id":"657b446d-7c8b-4a5f-bbca-47141b7bcd84","resolution":{"observed_at":"2026-08-07T15:16:52.705212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:52.479699Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"a8ebd994-76f2-470f-9fa0-aa119f53673b","year":2021},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.851544Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:11b0b0fc105704745a686f19bbd5c4c6561bc81be7a1b113b5dc2dd7862990c6","observation_id":"0a6a28e7-76a1-476d-b8b1-1be9f7ad0fe5","resolution":{"observed_at":"2026-08-07T15:16:52.528355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:52.337952Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":"b140fb32-8733-4719-876e-6477f38ef049","year":null},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.899861Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:4348591a92ef24a99e6c3a2937df58be07822d2e0fffe2ccdcef5423f85d327b","observation_id":"7ea27c20-0ff8-4ee5-bc91-8666b9c86b52","resolution":{"observed_at":"2026-08-07T15:16:52.402038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:52.099165Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"940d412b-a799-46c7-a9e9-1c698c4fa4da","year":2020},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.953896Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:b9cc628feab5431b59f2d2fd35aa0a716940730d20fdd5de285235862cb6a544","observation_id":"1a4e0909-d1e7-49d2-a539-f44c4fb74cb9","resolution":{"observed_at":"2026-08-07T15:16:52.246292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:51.946974Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"b34a3a50-909b-42fc-9984-d3c62f955495","year":2019},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.020468Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:d05583fd4f2da24d95c82987b1085945fefe80ea0926ec94254450dbf548fa8e","observation_id":"ea347c78-4b73-441a-90e2-ebcee0799b6f","resolution":{"observed_at":"2026-08-07T15:16:51.999624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:51.831443Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"4c4e4edd-9f9a-4d5d-b889-eaa8a1c541d4","year":2021},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.084629Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:02ca348b9f4145871eb28485766beffb5bc8953d69cfbbed21464041132c93c9","observation_id":"0a65854e-8224-4471-aa53-7cbc70ec7c55","resolution":{"observed_at":"2026-08-07T15:16:51.874722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:51.679364Z","title":"The fusiform face area: a module in human extrastriate cortex specialized for face perception.Journal of neuroscience, 17(11):4302–4311, 1997","venue":null,"work_id":"91cc8ffd-8c19-4fa9-b3f2-01ce1eb8a7c0","year":1997},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.161774Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:8da866f523bacf8632b5c5f837dfc2f1af05fa64a7c997fbc70ed5aaab199865","observation_id":"33355c04-f6a1-4421-9d5e-1064fb44ed41","resolution":{"observed_at":"2026-08-07T15:16:51.778661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:51.422059Z","title":"Brave: Broadening the visual encoding of vision-language models","venue":null,"work_id":"79d45334-5f1c-4925-9005-6850a9932fd4","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.210687Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:756dd66599b25cfe576b7152ab385e71eebbfb0e26db2883f455334dca39cc11","observation_id":"78b0fd9c-d8b8-4c01-8440-a4cc7e73a300","resolution":{"observed_at":"2026-08-07T15:16:51.547441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:51.233782Z","title":"Analyzing and improving the image quality of StyleGAN","venue":null,"work_id":"04bed59e-afd9-400e-9474-053d987ba586","year":2020},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.280838Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:c285bd731d31a98e61708efc2cddb0a6fc77340b0d913507b9bd5b959fdfe166","observation_id":"f2a9e73d-621c-4847-ba89-521d0a7bac30","resolution":{"observed_at":"2026-08-07T15:16:51.328737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:51.094244Z","title":"Token fusion: Bridging the gap between token pruning and token merging","venue":null,"work_id":"e62484ae-28f6-4109-9665-95bb8183cd7a","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.332896Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:2c62255da09e187e3095b00cde1c341cab349134114a319dcc0007c6a2f77f3d","observation_id":"abd7f974-9a22-4d08-9b4c-e0cfb807daf3","resolution":{"observed_at":"2026-08-07T15:16:51.162382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:50.903027Z","title":"Segment anything","venue":null,"work_id":"4a800364-f5fb-4ca5-bda1-ee62663a9b70","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.393450Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:d3d9287734fefbc47e09b6204fd20468e71c73b488407d1220ce9eff05fb3e73","observation_id":"b03de65f-0afe-4c33-a1c0-77c5b69afcde","resolution":{"observed_at":"2026-08-07T15:16:51.036563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:50.705525Z","title":"Matryoshka representation learning","venue":null,"work_id":"c42bd567-e931-45c2-a98a-78d277f874c4","year":2022},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.457482Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:2e3b8f7e7ce852f42e2940632cfe24c27ab1e1a5bebe8e48b4635348a17e0483","observation_id":"0da5b2b8-1c17-4620-87cb-e31e8ba1f682","resolution":{"observed_at":"2026-08-07T15:16:50.806787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:50.476558Z","title":"Pix2Struct: Screenshot parsing as pretraining for visual language understanding","venue":null,"work_id":"016a5db9-d207-4185-a25f-fe935c3dfebc","year":null},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.544049Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:9e270f2f194d06b65bdaee33f63179443fee9e5a01f4ddbd1e07d7dc7960d567","observation_id":"f7ac94bc-f61a-4437-a658-224935fe01de","resolution":{"observed_at":"2026-08-07T15:16:50.578210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:50.278141Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"3bf08a2f-293b-44c8-bbe7-a9315ddc3049","year":2022},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.642846Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:aa104acfeb8869ff657272c6843b29bb02967964f379ca5f636dc9f269874b69","observation_id":"94bf7d81-00de-45fa-a74d-5aea7949d114","resolution":{"observed_at":"2026-08-07T15:16:50.415669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:50.057817Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":"05275493-91e7-4ff1-b191-7e4f0ec83702","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.728624Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:d82e0e6ce40bbfd2cb874fc64e33975c83b8c3f2cbd58f416cf6c3d1d2907a3a","observation_id":"c9852cf7-11af-4ce2-b4bb-dee6783c6c76","resolution":{"observed_at":"2026-08-07T15:16:50.165291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T15:16:41.823139Z","title":"Evaluating object hallucination in large vision-language models.arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.823139Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:1bcad2651bf68bf44d84a1a21f28228ff37778653a0a3a9d3d98e11ff4d21a51","observation_id":"7ce839d9-13c5-4484-a914-15706ae8ce6c","resolution":{"observed_at":"2026-08-07T15:16:41.823139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.915520Z","title":"Factual: A benchmark for faithful and consistent textual scene graph parsing","venue":null,"work_id":"58003ca0-b1f5-4ac5-8d59-a0f804f0ec30","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:41.936538Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:2d714cc5589c8f15c519922c7d74e7784131c48f51a6af7deee08e7cc54fa720","observation_id":"53704016-9590-4dcd-b3ac-05b22c00250b","resolution":{"observed_at":"2026-08-07T15:16:49.958546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.767926Z","title":"Mind Reader: Reconstructing complex images from brain activities.NeurIPS, 35: 29624–29636, 2022","venue":null,"work_id":"e7945a99-b207-47c7-bb3b-0bbab6746c6d","year":2022},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.047073Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:18bb743a370f3086b0bdea57794dea9de6b7565e50bf47dc707999d0ddbe8b55","observation_id":"60a740ce-7852-4f43-b11b-72dbc513bf21","resolution":{"observed_at":"2026-08-07T15:16:49.854513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.578229Z","title":"Lawrence Zitnick","venue":null,"work_id":"1cf19635-03f6-4f54-875a-20dfe69bf2c1","year":2014},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.094523Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:f5ef532a2019b9536e5831d3ffef4e48138de81a5b1e2a6da30bdfd77732c963","observation_id":"63c620e6-b456-497a-8be6-6f161dcb017a","resolution":{"observed_at":"2026-08-07T15:16:49.634326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.351985Z","title":"Visual instruction tuning","venue":null,"work_id":"965f0b7b-d982-4b04-a4ea-4e29a77fde90","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.131165Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:7327b58b3741460df83f1bbd2025b66b9b2dc6d72411524938ca067485caec72","observation_id":"894dd367-bf7a-4100-a4bd-02bd42a32cbe","resolution":{"observed_at":"2026-08-07T15:16:49.445157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.076472Z","title":"Nltk: The natural language toolkit","venue":null,"work_id":"6017bace-b68e-4f45-8560-ed9eb81a9f42","year":2004},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.176007Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:2bb0e406dd41f75dd038d699edbe6c9bcf807e85377be737e4beaeb287efd07b","observation_id":"498ccef0-237d-4434-bf16-409cbf5d9197","resolution":{"observed_at":"2026-08-07T15:16:49.173873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:42.240170Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.240170Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:089fbefb4919e155c89b7e974a68e53f22d4a309ac364ff081c8ee1efa8c57c8","observation_id":"3c72c227-f608-4376-a7f5-2f04dba91cf2","resolution":{"observed_at":"2026-08-07T15:16:42.240170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.952820Z","title":"Benchmarking large vision-language models via directed scene graph for comprehensive image captioning","venue":null,"work_id":"03599f6c-2552-4eee-bcc6-0f7b693cc9b0","year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.287542Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:e553c0b45a21619d052df146fb6cd5412c8c2da3ca97f58e20f16da1b4834ff2","observation_id":"dbcbf07b-08ef-4466-8677-9adbaf041ebe","resolution":{"observed_at":"2026-08-07T15:16:49.000460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-07T15:16:42.359834Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.359834Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:7411a36ca4da2f9668c7c6627f07c2f1f021a3309696d60ebf8cad23e587b5fd","observation_id":"585b1d00-8f20-4c8a-9123-ffe8d5215fd8","resolution":{"observed_at":"2026-08-07T15:16:42.359834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.773525Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"86bdace6-8a74-46b1-ae41-9411a8b48f89","year":2021},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.446975Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:27d32b605025839ae78d8655c998f3082669f798404db600779db907fbbfd234","observation_id":"fa808e6d-fc21-4d96-b83b-55a9268f9515","resolution":{"observed_at":"2026-08-07T15:16:48.859241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.568759Z","title":"DINOv2: Learning robust visual features without supervision.TMLR, 2023","venue":null,"work_id":"8f087e2a-928f-417a-a6d8-953e58088545","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.531754Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:309487a80967a18d7b6dcee9f32908f0ab1efe70e1c746b6d0d595052afe3620","observation_id":"af3dd298-a5aa-4998-bde5-1b1149381372","resolution":{"observed_at":"2026-08-07T15:16:48.657448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.413047Z","title":"Brain-Diffuser: Natural scene reconstruction from fMRI signals using generative latent diffusion","venue":null,"work_id":"6f7f93b7-1527-4386-acca-4698ef3b96dd","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.619184Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:61d0872f5aeddb8e29f4be1a88c4cf0bd352aebc9f4af5481d594cf5a5161fa1","observation_id":"47499c3e-1aa8-42df-951f-d00b9bc44d63","resolution":{"observed_at":"2026-08-07T15:16:48.461309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.293108Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"66f357a2-3e74-47d4-89df-e96b662b3645","year":2002},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.726780Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:1e7d49daa65a161965c13df2647bb4d2827163d591b50abf7f2ea7ee264aad76","observation_id":"3e2f230f-b7cb-48d1-9e2b-32aa31467837","resolution":{"observed_at":"2026-08-07T15:16:48.369074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.160995Z","title":"Differential sensitivity of human visual cortex to faces, letterstrings, and textures: a functional magnetic resonance imaging study.Journal of neuroscience, 16(16):5205–5215, 1996","venue":null,"work_id":"060dc0a3-90ba-440b-84e0-f82389425473","year":1996},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.798335Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:02df273cd8eb6cc0fe5636631c49bf1004d7c5549794494080d370fed3ff6903","observation_id":"cbaa93ff-d50a-4fa8-ab4e-ce9c6395b1be","resolution":{"observed_at":"2026-08-07T15:16:48.201025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.033302Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"c705889e-6bdd-4188-ab44-29c3ee53655b","year":null},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.865111Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:52637bf4e3e42a11683f987c25c7b0bc6225afd90aca50391ea2982f6f43e93d","observation_id":"f6683897-d20c-482e-94c5-7b52b60d4b3c","resolution":{"observed_at":"2026-08-07T15:16:48.102969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.751998Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.JMLR, 21(140):1–67, 2020","venue":null,"work_id":"782a9abb-9a59-4b28-bcab-098afc4d0e90","year":2020},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.983593Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:501421a6d7fbc2a0f52f2e6cfa8d37310717f24ee0ed36236418be474dce02cd","observation_id":"a658534c-f50a-4e1a-bf67-015ce6026761","resolution":{"observed_at":"2026-08-07T15:16:47.811135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.607581Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"151fb59a-4988-4916-9d47-14110f5092d5","year":2022},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.008703Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:8d7ce62a52380fa1df82d98f8b6c1411024672f9a980859ae14c59c720f4e31b","observation_id":"7943ce1a-d2a0-42d9-87bf-22234e1fd9e8","resolution":{"observed_at":"2026-08-07T15:16:47.660888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.470900Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"250c115f-50b2-4f03-ac31-0440a74d4255","year":2022},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.035521Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:fcb066d32329dec9cc7aef50d913f3768bb7949ddd75d678265f1a1768a9f4a4","observation_id":"4236eac0-0419-46be-b8cd-cb1036ad93a2","resolution":{"observed_at":"2026-08-07T15:16:47.526897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.306264Z","title":"Reconstructing the mind’s eye: fmri-to-image with contrastive learning and diffusion priors","venue":null,"work_id":"0bf75f40-d6b7-4bf5-b74f-f954d0c840da","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.097221Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:0d1ce7a514f96b2f30a301b6412c59e509951bbff6c199dc540a26f7e607900a","observation_id":"d0d58c55-7050-4e21-8fb9-9281d6da150d","resolution":{"observed_at":"2026-08-07T15:16:47.375067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.209151Z","title":"Mindeye2: Shared-subject models enable fmri-to-image with 1 hour of data","venue":null,"work_id":"7d8f3454-0bd1-42c4-be0e-1e85df54d272","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.196098Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:b3a30bc21b9c92788fbdc845ed2dc808b2f443ea0d90b6c4d68878ac819f17ee","observation_id":"71d82b78-cb1f-4096-9994-5d29fd536196","resolution":{"observed_at":"2026-08-07T15:16:47.262328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.100092Z","title":"Neuro-vision to language: Enhancing brain recording-based visual reconstruction and language interaction","venue":null,"work_id":"fa651b79-eedc-42a7-9be5-ad1ab698a705","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.267167Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:59cb62a4dff5c97ee6dac0876b406ab062d116f83c3e142510876b67e40c1426","observation_id":"e6f3ed65-fbc0-4e0d-90e2-37bba47c8aae","resolution":{"observed_at":"2026-08-07T15:16:47.133289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.011128Z","title":"Mome: Mixture of multimodal experts for generalist multimodal large language models","venue":null,"work_id":"e5abab16-2924-4e07-9fc5-4ee993294210","year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.348922Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:29e44c006b53d3fb5e3a0d6f59bce050e9b355862e45ba8bc54ec07f4fbf6d3b","observation_id":"c76b1743-8c99-41b5-bdd3-ace2936fc17e","resolution":{"observed_at":"2026-08-07T15:16:47.047238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.871531Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":"0d733ebb-92b3-44ef-99e0-3df8eba29462","year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.398601Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:5b04876728bc528b7c21056df3a63331d602b0451ab3bb2a81f29cce414e487c","observation_id":"17e9cb20-1596-490e-be4c-24f3b6c49fe5","resolution":{"observed_at":"2026-08-07T15:16:46.941690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.762672Z","title":"Super-convergence: Very fast training of neural networks using large learning rates","venue":null,"work_id":"9ddbd3d6-1d74-4ba3-86fa-e8078dbe1b77","year":2019},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.435758Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:028c8e8d6fd141bd9ee360b4b51a3a1af6fadcc9e5201b3300e153df2a2cbbb2","observation_id":"a9fb3157-714f-4946-85d1-1bc7f0fb998a","resolution":{"observed_at":"2026-08-07T15:16:46.813615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.650276Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"6cc779c6-21b8-48c6-ba2e-f643e7987f63","year":2021},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.476022Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:29b11793a72b25f59e13328f8f42093b7566b79d68d72f25d5e936b35cbe2430","observation_id":"7f87395c-76b9-4ff2-ba18-e00b903d2b30","resolution":{"observed_at":"2026-08-07T15:16:46.706861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.488759Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"51483edb-919d-4b56-a1a1-f748de2cb9bb","year":2019},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.537605Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:3b2694db9fc2b8468f3c4c971219f0ca66601f63b991cf35c14aa44885915612","observation_id":"f756171b-d78d-4936-a86f-343c0b9ef436","resolution":{"observed_at":"2026-08-07T15:16:46.569992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11536","last_updated":"2023-06-20T13:48:02Z","snapshot_observed_at":"2026-08-16T15:22:33.242582Z","submitted_at":"2023-06-20T13:48:02Z","title":"Improving visual image reconstruction from human brain activity using latent diffusion models via multiple decoded inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11536","snapshot_observed_at":"2026-08-07T15:16:43.626381Z","title":"Improving visual image reconstruction from human brain activity using latent diffusion models via multiple decoded inputs.arXiv preprint arXiv:2306.11536, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.626381Z"},"links":{"cited_paper":"/paper/2306.11536","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:4a2b34901a88ba37e65e4c09d135db493322136ef06813feab7713d9b6161708","observation_id":"3890e0d1-e7bf-46b4-80cb-ee014125da9a","resolution":{"observed_at":"2026-08-07T15:16:43.626381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.366612Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"4da1d8fd-d0df-4bf7-a140-c8041e6b84c7","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.723593Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:fb32d8d074e9fd1401e6b28fcfa1c14840872cd31313791e75593858f24b0690","observation_id":"3ecf22bc-6ccc-46dd-831d-616cddc5a3d4","resolution":{"observed_at":"2026-08-07T15:16:46.408440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.253340Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"6227faaf-26cb-476c-bc15-c25fd08053df","year":2015},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.797248Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:668701a21b02be86470b4fd79287ae9e88dfac6675f5809c0e750eff4dab4761","observation_id":"04b15a58-02f8-4e7d-bb52-0695f8b08729","resolution":{"observed_at":"2026-08-07T15:16:46.307705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.132994Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":"3f9cef47-d9b7-4965-9f90-baac455d6826","year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.896942Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:c1aa0d4aa534ee1a161c86c92ce48e912007853ca354332225beabb03acd27b5","observation_id":"97b93f9e-9851-4077-9911-88fe79ea0f6e","resolution":{"observed_at":"2026-08-07T15:16:46.181743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.994262Z","title":"Mindbridge: A cross-subject brain decoding framework","venue":null,"work_id":"9424d90d-7579-414a-b6d5-9cbe58879b48","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.939911Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:c222b6fa49a942ffddac3568520c03f6fac6cf2402dd03cdb837721cb37e4c27","observation_id":"7aa6e714-839d-4e38-bdf8-262679d9b4a6","resolution":{"observed_at":"2026-08-07T15:16:46.063111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.855976Z","title":"ConvNeXt V2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"36a8d1dd-8865-443b-a392-f0326a5257f8","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.974482Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:d6aa0d39c6368b51c371410cdad43eafe00d013f32afd825debef3e7f90440c0","observation_id":"ecdfed39-eb49-472d-bc3e-6a231b43675a","resolution":{"observed_at":"2026-08-07T15:16:45.937209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.718950Z","title":"Umbrae: Unified multimodal brain decoding","venue":null,"work_id":"fa35d801-20f2-4390-8dd2-1f8ce004800f","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.048688Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:e2e61179f6b70c9bb48348d0e57c43899e53407ea22d2d32f954c6e4c8f85f9e","observation_id":"ec1cb38e-45e2-40d0-bdca-85671ec11111","resolution":{"observed_at":"2026-08-07T15:16:45.770874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.626955Z","title":"Dream: Visual decoding from reversing human visual system","venue":null,"work_id":"21e8271f-bb4b-4a15-990c-33498944d011","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.114827Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:c199a83dce508930face75e4a23a6e4e8e82f8d11758b31645aff1a1365c7019","observation_id":"0c38ce74-1042-4916-b061-326441070714","resolution":{"observed_at":"2026-08-07T15:16:45.661906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.513489Z","title":"Mevox: Multi-task vision experts for brain captioning","venue":null,"work_id":"d8cb77a3-6015-46c5-8bf7-edaa92b30468","year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.155145Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:9b2647ba81b626a578919734ad39ac07a6683131af0acdf62a38570519341ba1","observation_id":"b030d902-dbd5-4944-b644-9f6302edeeb5","resolution":{"observed_at":"2026-08-07T15:16:45.591386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.400490Z","title":"Versatile diffusion: Text, images and variations all in one diffusion model","venue":null,"work_id":"3aed0448-5fd9-490d-ba37-4971a21746d0","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.199109Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:17ac3739b9cedf638d2df2f0a7ade8f1f30c783972b1acd51135daad74110231","observation_id":"ea090e99-9cb1-46ea-ac05-0f03c753473d","resolution":{"observed_at":"2026-08-07T15:16:45.450042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.305638Z","title":"Dense connector for mllms","venue":null,"work_id":"a1824f2b-ed61-42a2-b316-98548938daaa","year":2025},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.239920Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:5466b5ecba1f2403f301fc8958d8a3a551c7cbd8700fd235a1528ec6b5446478","observation_id":"dc5a8203-d38c-44dd-b926-b14620841690","resolution":{"observed_at":"2026-08-07T15:16:45.331633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.219689Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"468143f2-c27c-4e77-9dc4-0b419ec6ceba","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.302629Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:e4112d93bc81c0f53df6304f18f3cb70064e9399f989aaf676270a56c50d5449","observation_id":"19bf626b-5eb4-4490-a700-f1ec87a71bfa","resolution":{"observed_at":"2026-08-07T15:16:45.259364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.117135Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment","venue":null,"work_id":"b1ccb272-1c33-4b12-9587-d11bde10af5c","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.430939Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:867a80e2fab391abd320a97f479ae7bd21d3606b55366097e69d51dfe9e74dbf","observation_id":"c59b7996-ecb1-49e5-8385-cb8d999ee82a","resolution":{"observed_at":"2026-08-07T15:16:45.147295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.029948Z","title":"Detrs with collaborative hybrid assignments training","venue":null,"work_id":"99f1d24f-ab5d-4f7f-b61b-54353343f87b","year":2023},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.504615Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:cb2adfd78ece205175ea8021907c256992dc2ec1903b63dbd7b7642bb7547b99","observation_id":"cb6ffba9-e0ca-4262-b05d-32df0f7f2165","resolution":{"observed_at":"2026-08-07T15:16:45.070960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.937374Z","title":"Mova: Adapting mixture of vision experts to multimodal context","venue":null,"work_id":"8a90b7f1-2545-4151-9360-4d339031cc27","year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.559080Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:6aee33aa3957264fab1829daa2c3497d4800e3c9b2adbd7df4f11ceae6f9adeb","observation_id":"f9f7e3e5-9712-4045-885b-a0eb277e0cc7","resolution":{"observed_at":"2026-08-07T15:16:44.986961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.885180Z","title":null,"venue":null,"work_id":"1e615230-06b7-4e05-8866-2eb8a65e3fc9","year":null},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.935474Z"},"links":{"citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:ca2c9df5e43dccccb342905e4e527823a6e92f5a722f0a2be980626f4439fd0f","observation_id":"603cf714-87c3-46a0-9af4-38d6b48f5976","resolution":{"observed_at":"2026-08-07T15:16:47.936612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T07:35:24.949450Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":64},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 1 inbound Pith citation observation for arXiv:2505.15755."}