{"as_of":"2026-08-09T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d802faf3fbe8b9641885fc782701e216f3f8acd6fbcc516ba7fd3e2a8e99e626","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:40:10.108333Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.25479/citation-record","integrity":"/paper/2605.25479/integrity","json":"/paper/2605.25479/citation-record.json","paper":"/paper/2605.25479"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:7a78a35819ec88b5b7c4650bd1357e8dede5c2d9ef86e5aa874bde0e09ad66ec","observation_id":"992e04dd-a6b2-41cf-8da8-5358ca445e37","resolution":{"observed_at":"2026-06-29T22:44:01.463778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:a9d49514cd8cd3f00865cafb07d2f93bd5aca0ae31a2db79eab57de7dcdfe296","observation_id":"0326633f-c968-4b36-a692-9ec17e49978d","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:7e34c6dd7422613f796dcb57e3e5c1ce69f2533eb75dae720c1d0d3a03a02d1d","observation_id":"df8e4d00-85a0-4214-b987-d4cbf8e8b722","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:aa98630628f04ae6ab6f8ee9e60c20081246a6be2db4592eb73af4eeee4eac0f","observation_id":"b01d33bd-a95a-4853-ab78-a7a0e1c130b2","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21772","doi":"10.48550/arxiv.2511.21772","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2511.21772 , year =","venue":"arXiv (Cornell University)","work_id":"587f4077-f4b1-40eb-8193-3be3b96294f0","year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:97d5daf4d9b33508093db38700c6b844ce23dd7a9a3516e39c147ec06e272a64","observation_id":"da35c657-7a4b-443c-9eeb-b42f3f8023bf","resolution":{"observed_at":"2026-06-29T22:44:01.457361Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Cp-clip: Core- periphery feature alignment clip for zero-shot medical image analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:f7aeb863402482ef7d97fda5c2b229f980f2c330a522e58d985db6f59397bb11","observation_id":"9590a9a0-da35-49a6-af75-364e296a19f5","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Vpl: Visual proxy learning framework for zero-shot medical image diagnosis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:947f37527f6fdd240b0255e0dac4ffb31cba31e4b7a0bf4c6aa32500999dc469","observation_id":"a96f39f0-b6a7-4821-b4f4-41845e6e0367","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Medclip: Contrastive learning from unpaired medical images and text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:96afefd787c3a26600f887778f006bc5b6f5a32a58441e1fb9be2dc2ae23dbf1","observation_id":"69da6986-dd80-449f-b039-214e0afdb685","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Pros: Prompting-to-simulate generalized knowledge for universal cross-domain retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:e5cc568628eadc4062acfb5c23741f547f06e6f1687072895571f19e5d47cf0e","observation_id":"ea79b72a-9672-4306-a769-6e3b63c12818","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Depro: Domain ensemble using decoupled prompts for universal cross-domain retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:85b941d2107604ffd6c95850fff359d77e814007ddfeb7ed1c8035019e2ecb9d","observation_id":"969637b0-7bf3-4095-ba78-55a833cff838","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"cited_work":{"arxiv_id":"2505.21549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21549","snapshot_observed_at":"2026-06-29T22:44:01.449286Z","title":"arXiv preprint arXiv:2505.21549 (2025)","venue":null,"work_id":"4339d435-4ad2-4245-b4f1-ae058c618d9d","year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"cited_paper":"/paper/2505.21549","citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:289c871cc9046cb3ccdf8615b499943e526efc9b31fcff1d41d16bb2157ee3e1","observation_id":"cf5c23bd-f9bd-449a-aa6d-c135d760bb0e","resolution":{"observed_at":"2026-06-29T22:44:01.450876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Building a multi-modal spatiotemporal expert for zero-shot action recognition with clip,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:7827a6f191474036ea2c000ec883951710cfef3f77003af5b415afe3ff8612d0","observation_id":"0e4813c8-df96-4405-b3ce-000cb89a74f5","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Leveraging temporal contextu- alization for video action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:57263549216fa6863aa03478f24b156718940e9061ea98cfbf775ec6fe508663","observation_id":"b2e48ed2-d29a-488c-98ff-cea4fcbaf4a5","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Open-vclip: Transforming clip to an open-vocabulary video model via interpolated weight optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:fbcfa6d620200522135d08db2ea8740bca4783c9ad2d144ec71efabff41a8337","observation_id":"5c421381-d968-4398-83b6-1f90b8ada3c1","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Learning to prompt for vision- language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:6e68cc5a3a9549cc32c3509fe91b36e4fa46e89bdeb9d1931eaf57b256e99b23","observation_id":"7fa52433-aac7-47e0-bcf1-ab042fc13da8","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:d6b702e915d9219488e01fed156f060c204c5a835aed1d31996460e201d45f1f","observation_id":"776412d6-ced3-4dfa-bd60-f038ea57b9ec","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Visual-language prompt tuning with knowledge-guided context optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:06f840eac75ec15d5f82c4776caed2a3fc51d624bb9f343a6f7bed199ff44dd6","observation_id":"fbd06bec-ab04-4f22-931e-382546746f42","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:fcacf6e58bc820cec4c200fd21bd4690135530c422490453b923ed4ce58d3c55","observation_id":"667653dc-a60b-4db9-8c62-f584b430ad86","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:c01776189eb5330068763b850b9b951d63cf822560e760ddd7ac9fb576430f9a","observation_id":"9cf2aba9-ac7e-4592-8a79-764c4ed1aae8","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Mmrl: Multi-modal representation learning for vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:403b8991a90659ec5bb10b61776fc0431f290c90db7f4d0295b6b3fe6bb9fa23","observation_id":"d6c56974-9c0d-4f0a-a209-2f77b7676fd6","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2104.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-04T14:59:55.372222Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","venue":"cs.CL","work_id":"1056ba8e-7b3f-4811-be8e-9a3ed9269acb","year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:45d405900dba8e3ee6bd773ad6677db67beaea6ca1d247e850c990096eef6c28","observation_id":"b45e2041-2883-462b-ba96-11665a76d92b","resolution":{"observed_at":"2026-06-29T22:44:01.454414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:16d8f18729546108eda787a90e574b6479e8dd0c8c6bfeb7a502b68d9b0d537d","observation_id":"a4e49347-c519-4420-bec0-5335364eef30","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:40b5310e4a3b201333d560b854ce60b0f14769eb6f0955f4e8e20572f1f1e95d","observation_id":"d8e48f86-a9f7-4bab-9625-855813514b7f","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Mma: Multi-modal adapter for vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:80ab21316671a19922e211fa73661f5e09e73b841ff94fc5d78f1174bd338f55","observation_id":"7be2556d-ed72-4e07-b8c2-428effb1ffd5","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Scaling & shifting your features: A new baseline for efficient model tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:d4546296672cc9ac1f35bea598032f329fefe0f1d8f2a87a7b0f1884aabc655d","observation_id":"143b27d9-b305-4486-8d0d-9395b9317ca3","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Multi-modal interactive agent layer for few-shot universal cross-domain retrieval and beyond,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:254bbaec12dc7e12076dec8572de912e7aba0d9f499a6d82e9a0ce4c443e1364","observation_id":"9500fe27-4700-422b-9ffb-6395f60786c7","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:5d6f11e36fbcf6000d1ae4555317be4af0dde60d56d76acd52796db0bf365919","observation_id":"2bdd98b8-33db-4113-8150-bc6d4bc125db","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:0f50f9720582c243b81bf13f38a0d5a21a56b78ef9dbdcb19388992cac9d2673","observation_id":"bee89f22-6100-4c4f-a9e3-8c750374d758","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Vlmo: Unified vision-language pre- 12 training with mixture-of-modality-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:e579cf37a96500c07eaa1100d7550e45acf89860dd3093452c3f065e669c182f","observation_id":"3fc24b0a-1085-4894-b559-21291b11214b","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:c84b087baa17e811752f942d98b8885276fc366aa9b6667dda26f9746df7c3e7","observation_id":"d8ef49b5-f256-458c-803a-e1f016c51fc7","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:eaab174f98dd1bc7cd276b28d8fd09ddce723ac3f14da9cf571f85df2234dfc5","observation_id":"918bb84d-aa35-4c01-ac7c-2490ad2e7b3b","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:30da494e0e588e47ac3a664e9dd78ea2a70af151a68505d566d28375e8f68739","observation_id":"ce677725-b034-4345-b9c7-fa2419d11132","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:87925708db743b2fb7a558a068aa8d93a7c47ecdb043e855cf2887ede6b6b956","observation_id":"d71f8aa0-7ab6-4d4b-8fee-e2c6b9fdbea2","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Bitfit: Simple parameter- efficient fine-tuning for transformer-based masked language-models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:96d1b7f6972b2b2fd30794eefb65f78f77f30de0a1b8e8433e8b0c2ef5fc872b","observation_id":"425f9359-f853-4436-82e9-33a02a482345","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Learning with enriched inductive biases for vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:720e4b1efcb8ac708070a67f4188812d464efbabfa757ecf331636c82fcbb576","observation_id":"1b473cbc-a176-46bb-a819-62e483f4938d","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Not all features matter: Enhancing few-shot CLIP with adaptive prior refinement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:daeb086bee7d89a346d6699dc8ba1b3a1cb6bbf399cfc8d4b8fdddcd71b158ee","observation_id":"e8df2e91-4aa0-4156-bdcb-9d7bdfbdf19a","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Task residual for tuning vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:3f601add236deca707fb58aa5280c2b2d317d8eb3d6c7985e3c0ff6c2b79aad6","observation_id":"89facad9-e895-4d0b-8d3e-bf529d32b59d","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:4456d728d5d1557f7bcd019fa46cc6dc09ed3475abca56142710dc237bded167","observation_id":"f8f16d64-8ac6-4804-8dd3-e1fc83ecf811","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:26a7692f2102b08b43060508a62396535636e2b68700d3be5efa6cc4e2175873","observation_id":"4aeb8e29-5cfe-420a-8794-f1ae7b2e4fb3","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:d6422a6f4ae7f16bb06fea37677061f0919ec7101041018aba16e7ac1147c0d9","observation_id":"6e726c4f-339a-4614-92ee-5bbd4926af4f","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:dde9d2d8919793c23d1927e761741d0d27bdba9180ee94519f0f73b7fdf20c40","observation_id":"97044348-37d3-4c02-b202-f0184dc999ab","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Cats and dogs,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:22094febee6e32f623ebf166162ebd53da7eba710462b6ea7e618ba73e3ba32f","observation_id":"2dbd24bb-d811-4cde-9136-1ca21837bd01","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:d52f26c7c58f285f547fa4e4ac13fb0199da27ce217958d93bf4e735380a6ed7","observation_id":"6b61579f-c24b-4ac7-8b97-960bf17f1d20","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:906dceb85579e862c31984a17bced25812d0586ff2d9c552aa5a07c291c69a5b","observation_id":"297235c9-f9ee-498f-892d-e6222d7d72e9","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Food-101–mining discriminative components with random forests,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:86c0eda05e39b269dba75d56a8bc5db211748ac4514cd82ecda7b953b23c66eb","observation_id":"68427a17-e17e-4f05-9d07-2fa07e4aa935","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":"1306.5151","doi":null,"metadata_source":"pith","pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-07-11T03:07:53.092922Z","title":"Fine-Grained Visual Classification of Aircraft","venue":"cs.CV","work_id":"ed360110-3ce4-4959-8c74-1785cd9e537d","year":2013},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:f3d9c87fa980988ef7f8fdf2158fff628114a37986e8835b604f8e9bf712da05","observation_id":"a36021cc-78b3-4fbd-b227-1ff06103faa5","resolution":{"observed_at":"2026-06-29T22:44:01.447672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:02efed666267138414defb47ab3b028c90bc72e8aa70946d26193f3be99902f4","observation_id":"0e307de1-8908-43ea-bb42-6567c367a4a4","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"A dataset of 101 human action classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:51afe897fa022fd94d85eea82b4ee489c2ff5520f3955b7d964daa314344b788","observation_id":"3fd93f93-afd6-4296-9950-8474a5971ef4","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:5b74a2100c842a476da8e3737c222755355008044da0b5ee1fb41d3b4741acb3","observation_id":"67c31fa7-9e9a-4a62-a735-ebe3044f8d7b","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:2123019b49f59c150c9ae6703c1b59349cf495eba5637371f537d933e8569647","observation_id":"63b3f018-d004-4c2e-8f60-5f2c907040d9","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Do imagenet classifiers generalize to imagenet?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:e2d6015a0cfec76044917fcfb556227c01b55263f5bf6ce254a8ee0f83dcc7e1","observation_id":"7231f43e-3f34-44f2-9c5c-2ec0440fc988","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Learning robust global representations by penalizing local predictive power,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:55bb43dc57bf39688ef66a82fd7e3f730fad2a8a7341a6aa31de388b7fff93d9","observation_id":"ed4039c3-9bc3-4b15-a7c0-04526ebec405","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Natural adversarial examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:6785a3b0910c76257534295a4c7d6748a8121faac96c33f692c816166ce48961","observation_id":"1f3abb92-4ba5-4039-8d86-196336e1b920","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:c68978349fd5bf3679c968c683b06dab3545a271b5e79b7e2038bf568db5e57f","observation_id":"5f0708fb-a9dd-465e-adc4-ce6e83aa0c4d","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Moment matching for multi-source domain adaptation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:c8ffc332739799777120385b5c5b27ab0da884d1b3c204727c95906ca8bb0084","observation_id":"77935810-de96-4a9a-af3c-9c8fbe8bfd9a","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"The sketchy database: learning to retrieve badly drawn bunnies,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:af88e99fdf10439e13e43ef72440e7d73b5ae00e265242f63001f4afec8dcca8","observation_id":"3b884223-0559-4206-a4f4-da0dbef047a6","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Deep sketch hashing: Fast free-hand sketch-based image retrieval,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:daf695651da79b46a0d98caba672a637b95f1b2d71bde1793ac1cc164c89d2f6","observation_id":"98fca510-8bfe-41c0-9329-0a04adad9a81","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"How do humans sketch objects?","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:72c75ee55f7936156f3c4135903763d1ada85d7b3a39294c2c93613a25133586","observation_id":"61a97fd1-cb6b-4d14-958c-851981d987f6","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Sketchnet: Sketch classification with web images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:d305ccc652d37fd0c5a0d81e911d173bbb1d49a7ba442b6a1b47287403a1123d","observation_id":"a5e52f92-a3d4-42b9-a688-3db858ae88e9","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Tcp: Textual-based class-aware prompt tuning for visual-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:fa5f55e7349cbe7218a4926ae96a17c2cbe18cb043071cb50e666071456b8276","observation_id":"b0d16e8f-d448-4d2f-b631-d9d9f437d7a7","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Divergence-enhanced knowledge-guided context optimization for visual-language prompt tun- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:cb60b5d6c8212f8b9d1425e1e0dc6f02fd6be4612dcfaf004f7f68d06c964cf8","observation_id":"10695c7a-8441-4fb1-a90f-135e14042b69","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Bi-modality individual- aware prompt tuning for visual-language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:6d756a476dbdd4b5cabb598bf3f39f5294a71c93b010c9217c7ded80f096eaff","observation_id":"11581c72-621b-4718-905a-054609fc1c18","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Frequency-based comprehensive prompt learning for vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:8378bc77cbfbb8a3514d844e17c904d9772d4a57c27f9f97a2f9ad45eae47de3","observation_id":"467015b1-0524-463c-a7d1-c9d3c6ab69cc","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Hierarchical cross- modal prompt learning for vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:ad845144a289bea58b6711999786dfdc9e228b9092d03f114d1ccb49cad414b1","observation_id":"4cf539b8-0013-4ede-8433-6f91f6322b66","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Promptkd: Unsupervised prompt distillation for vision-language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:1f008d80ce33c66e08f3d643150f0938316e419c312517179fedaa27fbed786e","observation_id":"ada916bc-52bc-4f23-9856-33ffeda88a51","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Adapt- former: Adapting vision transformers for scalable visual recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:fa2521d98b3b0393b9b639c1ad418d220ab18bec06822be00913835e3c4a14ab","observation_id":"426fef9a-c597-4e1a-8c49-f946d3ddf1b8","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:40:10.108333Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:f589de009db1ebd0ac78eb1d427bcb659efce6370eca422e7abbaf8242f220b3","observation_id":"7133d924-1d48-4059-9803-1da5da9c7cfe","resolution":{"observed_at":"2026-06-29T22:40:10.108333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":62,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2605.25479."}