{"as_of":"2026-08-08T21:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23c6241cae672adc4fec56405e53d4e882bb9b21c9fdb9dfedff5a04c1e605e2","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:04:53.714175Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20029/citation-record","integrity":"/paper/2505.20029/integrity","json":"/paper/2505.20029/citation-record.json","paper":"/paper/2505.20029"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:04:51.463444Z","title":"Phi-3 technical re- port: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:51.463444Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:524fec13846699dd2f256891d3f21eef1b374d8574fd405a8a4d7ff6715fb5bd","observation_id":"6008b149-f63a-466c-a1c2-7c0720922511","resolution":{"observed_at":"2026-08-07T14:04:51.463444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.182885Z","title":"InstructBLIP (Dai et al.,","venue":null,"work_id":"887f6e01-1be0-4fef-a420-2d6264173603","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.323012Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:9aa09a450a9a3246d53888e2c001a07f8775658d527a19a3ee959b9381770987","observation_id":"5a3b562f-ae32-4eff-851d-50c54f913806","resolution":{"observed_at":"2026-08-07T14:04:55.237159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:53.867210Z","title":"Yes,” “No,","venue":null,"work_id":"d3fddb59-d499-4649-924e-2f0e408fe620","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.714175Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:233659d807accb8fdfd19397c5f8748b3b6354b499cdc49dd3c406647e6cd0db","observation_id":"4272d690-7d15-4aae-97b4-ef46650da518","resolution":{"observed_at":"2026-08-07T14:04:53.950680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:04:51.923241Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:51.923241Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:a5e871e852f9c2a1f23d92767427bcd9131e261876bc94c46200e0f9f1e78797","observation_id":"1a9ad026-2a66-4868-8c9b-e735d6bf5ea1","resolution":{"observed_at":"2026-08-07T14:04:51.923241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:52.296677Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.296677Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:b04d418892d3e1f35fb9ec8c14c8f5696e8e70b7e234b5ded7aa190137efe8dd","observation_id":"bd294af3-9fcd-4021-b3eb-bc9e08df4189","resolution":{"observed_at":"2026-08-07T14:04:52.296677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.358333Z","title":null,"venue":null,"work_id":"56099412-6bc8-416b-a70b-1fad15d777ae","year":2022},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.486214Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:9c03f36ef3edf395b121a5cd734f5a1ff56263e6ab6155ae01165065809ae45f","observation_id":"ef5420d5-bf60-4a57-aec7-a18bbfa206fc","resolution":{"observed_at":"2026-08-07T14:04:56.492727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.110225Z","title":"Speech language models lack important brain-relevant semantics","venue":null,"work_id":"1d869bdc-36f5-4893-b41b-8572bad32ded","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.556342Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:dc6665a16453b59c579cb5f5d381f701a7e36fd2c9672fdb0fcfde638271c2ba","observation_id":"d1bd5683-8ad1-4bfa-a72d-2b274f026b7b","resolution":{"observed_at":"2026-08-07T14:04:56.210466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:52.703135Z","title":"Tuning in to neural encoding: Linking human brain and artificial supervised representations of language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.703135Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:07257fd4b225fcacf4f77f4448df448c45ee0ab1406a4c3887a95bd5ee404c7b","observation_id":"32fc21fb-8b78-4d9e-9d17-1bafb46267b0","resolution":{"observed_at":"2026-08-07T14:04:52.703135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:04:52.788312Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.788312Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:f6db2f8f2ced910f258bfa35573b20af879b0ad5134b6aacccb1357a445bc86c","observation_id":"30d43f35-4313-4945-b3d5-643980756172","resolution":{"observed_at":"2026-08-07T14:04:52.788312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.700498Z","title":"Natural language supervision with a large and diverse dataset builds better models of human high-level visual cor- tex","venue":null,"work_id":"9056d177-8e2d-4b0a-9096-ba5061253b20","year":2022},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.944682Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:4ee834af14f069d67dea06bd884d7f355d65d38e114fab4624bb2275fea73d40","observation_id":"40ee46a3-fcc9-4991-9ee2-c181b98ac617","resolution":{"observed_at":"2026-08-07T14:04:55.788664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.512715Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":"ce11d508-d381-4196-82cc-94b2c3e988a2","year":2020},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.035379Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:b276c6ba01d93ec011717e448a2a94ac5965cdec5e794994959979630687b707","observation_id":"0154a279-ab1c-4c37-a938-4adaf1defe66","resolution":{"observed_at":"2026-08-07T14:04:55.603814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T14:04:53.137091Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.137091Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:24399ccc792d60034be67d5e1ddc161b91ed429a64b26eb4c92e73560ba353ef","observation_id":"e5e9885c-13ff-4e8d-b582-05c08cc75bab","resolution":{"observed_at":"2026-08-07T14:04:53.137091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.315037Z","title":"mid temporal lobe bodies","venue":null,"work_id":"66685022-89d5-4c5d-ad0d-f9654a085158","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.218111Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:0cc17410634fa412e1e9df6a353d108a2b3c9b60ae59eb0f094c279daa361f8c","observation_id":"b27bc93b-42a4-40a4-a7d5-a0b7defa4b0a","resolution":{"observed_at":"2026-08-07T14:04:55.391941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.051373Z","title":null,"venue":null,"work_id":"8bdf823b-06fa-41bf-a41c-d0c707ea4796","year":2023},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.385595Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:d3abfeb3da576857aa457470d663a665d762336557a6258ea9fce1fa477453bb","observation_id":"01491c0b-48a0-4842-ade4-c7e0d4003240","resolution":{"observed_at":"2026-08-07T14:04:55.116310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:54.860235Z","title":null,"venue":null,"work_id":"3622ae43-6108-4ce7-9dfc-763613467621","year":2024},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.471257Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:11e5761155ca6fe3fd739b4e1a321bfc63c7ffc02d356b11ae82964aef381b5b","observation_id":"2d486ccb-729d-4194-bb47-984abd3823a9","resolution":{"observed_at":"2026-08-07T14:04:54.987578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:54.569129Z","title":"The color bar highlights color codes for each instruction","venue":null,"work_id":"ca06bc89-8461-4a57-b751-61a10f3597a8","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.511816Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:dac7c765b060bb4b8339cb143088ee5a1abd26b734c81bf8f1026f8a38304e80","observation_id":"fcfa8868-7021-4d47-8262-27de04c40461","resolution":{"observed_at":"2026-08-07T14:04:54.702164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:54.027701Z","title":null,"venue":null,"work_id":"096c77e5-88d7-4fe1-ab5e-d377309bfad4","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.630159Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:f119cc97aed2c7e7dfcb0bb14efc73c84d9d3fb47ca5bce3b3a3e2d7657d72c4","observation_id":"a993ba63-c9ec-4e8e-8890-80fabe7ef333","resolution":{"observed_at":"2026-08-07T14:04:54.163990Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:54.308481Z","title":"The color bar highlights color codes for each layer","venue":null,"work_id":"aa6cac08-3cda-45b0-a429-0205a0678922","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.570042Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:e76230d9544190901667452528250a00badbe63b7826294bf96492b9afb72fa7","observation_id":"4a698fe1-db21-4942-8ed8-3644532d760d","resolution":{"observed_at":"2026-08-07T14:04:54.428394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.798675Z","title":"Shared computational principles for language processing in humans and deep language models.Nature Neuroscience, 25(3):369–380,","venue":null,"work_id":"4eb1f113-9467-4e5c-a086-7e04fb8a5ad4","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.053045Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:a745f1ba85986e3d3a47a7980c4b5b2f56d790e1f103a2d95a4290195b518376","observation_id":"49f1b797-11f5-486f-bd89-5ac289dd2bd0","resolution":{"observed_at":"2026-08-07T14:04:56.870712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T14:04:52.192451Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.192451Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:e827fff628c9324abb44500d8ca76e277bb24b2416c3cc3c24bb8f41706c8004","observation_id":"077b16f1-8bfc-4cd6-850a-d2ce1188c6a1","resolution":{"observed_at":"2026-08-07T14:04:52.192451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11737","last_updated":"2024-07-06T05:26:33Z","snapshot_observed_at":"2026-07-06T13:55:41.552052Z","submitted_at":"2022-09-23T17:34:33Z","title":"Visual representations in the human brain are aligned with large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11737","snapshot_observed_at":"2026-08-07T14:04:51.812008Z","title":"Semantic scene descriptions as an objective of human vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:51.812008Z"},"links":{"cited_paper":"/paper/2209.11737","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:548c5a626c19aa7e96ab5057de54a9fe03f20a942f38eb997a99617ee65fa7e9","observation_id":"ded41309-6046-4826-9a9a-4b67125ee344","resolution":{"observed_at":"2026-08-07T14:04:51.812008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:51.690010Z","title":"What can 1.8 billion regressions tell us about the pressures shaping high-level visual representation in brains and machines? bioRxiv, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:51.690010Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:00c48ecd4dad1f1c2a55b446696ce7b1196ec34e8837fe7547c981d73a3ded55","observation_id":"4031bc71-7040-47ef-b0ef-5a4a88e636d4","resolution":{"observed_at":"2026-08-07T14:04:51.690010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T14:04:52.633416Z","title":"Learning transferable visual models from natural language supervision, 2021a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.633416Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:caad282977228c300c6e7f0b42ff9b1da4370c6068ea677002a1810de8f49a16","observation_id":"b3c81966-98d0-43c4-ab4e-1a65c5eec772","resolution":{"observed_at":"2026-08-07T14:04:52.633416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.887420Z","title":"Neural taskonomy: Inferring the similarity of task- derived representations from brain activity","venue":null,"work_id":"de190b0b-f7a6-4def-a125-53beb3697941","year":2025},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.844290Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:dc90ee4ee1b3b8f7b5dd3ec9019a39aa335cd10003e90ac4380e54b1e2591bdb","observation_id":"2da6bc0d-5468-4a17-8ea0-d5438a48a744","resolution":{"observed_at":"2026-08-07T14:04:55.980113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00575","last_updated":"2024-08-09T04:33:58Z","snapshot_observed_at":"2026-08-08T04:03:21.538549Z","submitted_at":"2023-12-01T13:31:02Z","title":"Instruction-tuning Aligns LLMs to the Human Brain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00575","snapshot_observed_at":"2026-08-07T14:04:51.556068Z","title":"Instruction-tuning aligns llms to the human brain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:51.556068Z"},"links":{"cited_paper":"/paper/2312.00575","citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:1f7417f35a9cb1c0213c3405014ea5e0e1e50658583cd6565829c1e96d7a4aaa","observation_id":"2b172c6a-0b48-41b3-9ff3-20874950eab3","resolution":{"observed_at":"2026-08-07T14:04:51.556068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.638604Z","title":"The brain tells a story: Unveiling distinct representations of semantic content in speech, objects, and stories in the human brain with large language models","venue":null,"work_id":"c7bbd898-7a4a-4063-9f62-090b7e09f024","year":2024},"citing_paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.401068Z"},"links":{"citing_paper":"/paper/2505.20029"},"observation_digest":"sha256:21ab44e90bc9dcd211a9ad6ab99a8bbaf0ee98927d482b22f77251e0e2a0d5cc","observation_id":"0960fd90-1235-4a58-b508-589fceb87291","resolution":{"observed_at":"2026-08-07T14:04:56.721573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20029","last_updated":"2025-05-26T14:18:15Z","latest_version":1,"primary_category":"q-bio.NC","snapshot_observed_at":"2026-08-07T13:58:42.294331Z","submitted_at":"2025-05-26T14:18:15Z","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2505.20029."}