{"as_of":"2026-08-16T13:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1dad4afdbcc7a7f79d2d924f2098d564a352730377fe9d21ef30f98e346fabd","coverage":[{"denominator":287,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:09:18.495392Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12748/citation-record","integrity":"/paper/2608.12748/integrity","json":"/paper/2608.12748/citation-record.json","paper":"/paper/2608.12748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.131394Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.131394Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:79bc404fc23d04cfc0ddcc13a2f5f5f49c36a39091cdd92a20558e9d2cd755f4","observation_id":"d5ada3e7-5e40-4954-926e-02eec0f49532","resolution":{"observed_at":"2026-08-16T00:09:18.131394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.135472Z","title":"Applied Sciences , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.135472Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:01459a1da83f4cd1f0f37afb6065ba1bd50be48a54d0abd18be062e64c303e09","observation_id":"a81588f9-4d07-4de5-8d0e-2e7ba330ccfe","resolution":{"observed_at":"2026-08-16T00:09:18.135472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.138865Z","title":"Signal and Data Processing of Small Targets 1993 , volume=","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.138865Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:133f98922e390d9a58c0663f47362b634e890b0c5fa1ab2bd6c6faa7a73e5389","observation_id":"7a1532a6-cb00-4695-8031-9a8beedf3cce","resolution":{"observed_at":"2026-08-16T00:09:18.138865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.143478Z","title":"Sensors , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.143478Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:bbeea4d6e1536e91f1121de7b0d43a8934a9d54352bd2b825218d585d12ad050","observation_id":"3febe7c0-0ae0-40c8-80fe-e7aed9825ef5","resolution":{"observed_at":"2026-08-16T00:09:18.143478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.147495Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.147495Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:3a8ab250fd52ecbba5c1078c1b967e6f498c5fc6f4696c3fa37b5bee06d29827","observation_id":"f5a86670-90e2-4c0a-aba4-449af04cb6c5","resolution":{"observed_at":"2026-08-16T00:09:18.147495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.150786Z","title":"Sensors , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.150786Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:602946dd8717e7ed9d3070de955b7bc59409f5d3473754ad26f27cfc642153f9","observation_id":"cb5ff312-aa1b-4059-9149-a9c07845df58","resolution":{"observed_at":"2026-08-16T00:09:18.150786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.153828Z","title":"2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.153828Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d3b832762e2af03725d9dd64c7fb0e96eeeb878b90f3ddf1a6682500975b81a2","observation_id":"6cac7bdf-ef22-4c44-96bf-66fdb7166eae","resolution":{"observed_at":"2026-08-16T00:09:18.153828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.158526Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.158526Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:04bed276451915c6f92a3cd67adbab663addfe0b6f23285911838ec24f75891b","observation_id":"c637ee4e-6a73-4ed3-acfd-8baccf73b7a7","resolution":{"observed_at":"2026-08-16T00:09:18.158526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.161713Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.161713Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4f67efce4f6f22f165d312832db3ea3cf00f6da1f7095a8644964a374a5885fb","observation_id":"ee327802-dd29-482f-9599-43871f64980d","resolution":{"observed_at":"2026-08-16T00:09:18.161713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.166091Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.166091Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:2eb2b7a15b8c0120a6490068c19b7ac6c49aa0f28447dca3fb91441f23076aed","observation_id":"6713d00b-68a6-407a-ac83-7f0e7df22efd","resolution":{"observed_at":"2026-08-16T00:09:18.166091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.169235Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.169235Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:88ee37baf9ca2a635cccf36b1a5cc452044877365882cbf2611be43a5585265c","observation_id":"198ced30-915a-4898-b3d7-56b6f1096078","resolution":{"observed_at":"2026-08-16T00:09:18.169235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.173688Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.173688Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:915db84834769d387813339429532d73e97c24ae69a2bdbbcf3590277d8aa6eb","observation_id":"1ef4a677-338f-4948-8ef1-88dd4e14e538","resolution":{"observed_at":"2026-08-16T00:09:18.173688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.176903Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.176903Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e8fbc5070371ea17a9b6f5d9d61781780c77fc86b4b00c25683f43028e893466","observation_id":"f40c3e1e-bc8a-4f09-ae70-5f1976c6468d","resolution":{"observed_at":"2026-08-16T00:09:18.176903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.180236Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.180236Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a70e46dc6a2afaae0f9f5948dfb1d9da70b457c494a2ce375a2028d6a148b7eb","observation_id":"a44725a2-b514-444d-b8f9-0221777dcbf7","resolution":{"observed_at":"2026-08-16T00:09:18.180236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.183249Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.183249Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f5ed12f12da219bc720f228885dc62e0f6b55bc832f1fd7098af9f2fbbd019c5","observation_id":"2384866c-174a-4bfc-b306-6b373233115a","resolution":{"observed_at":"2026-08-16T00:09:18.183249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.186095Z","title":"Infrared Physics & Technology , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.186095Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:60f53d3c216ca7b3fa55665cdbed8ebd6561289b7cbff56a43dd26cfc129bb4d","observation_id":"3150fbd9-0146-4dc5-9f1e-09ffd12aff8c","resolution":{"observed_at":"2026-08-16T00:09:18.186095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.189270Z","title":"Kaur et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.189270Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:fb071e8f1a44d3235a6ad2c1240fe110b16cc78982e65c1d89bc4d1696f9cbbf","observation_id":"a41111da-8d77-4612-a8ce-e501f6f99bfb","resolution":{"observed_at":"2026-08-16T00:09:18.189270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.192080Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.192080Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:24aae4862c86fb96af912468112c54a5776cd06afa54b83a13cb8607df5c9d32","observation_id":"ea7d1d10-5292-4302-826b-a1e991a320aa","resolution":{"observed_at":"2026-08-16T00:09:18.192080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.195382Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.195382Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d4ce0acf14310752d972b23f959f424a6559d364ef1e042b17be0e96fed8efd5","observation_id":"738f01d4-a2f8-47b3-8b23-7b6b60045d01","resolution":{"observed_at":"2026-08-16T00:09:18.195382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.199801Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.199801Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7caa837781eda8cfd59576ecbefce81defbe459aada05e17d638081ef57420bc","observation_id":"169abf66-44fd-43ea-a19e-a84eb2cf17fb","resolution":{"observed_at":"2026-08-16T00:09:18.199801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.203629Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.203629Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4ee8baaf8b9fa719bc2039a057004f3a695b3070fc2ec22fc2d2bc1e734f70f9","observation_id":"fb978c6a-5f8e-4476-9cb5-8f2be0c79f39","resolution":{"observed_at":"2026-08-16T00:09:18.203629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.206600Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.206600Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:364d03d510fcc8ad2debe72b46e8b8f6135e8cd8b9b0af384871b09eaa938095","observation_id":"6a3d78cb-6c88-43a7-8995-2200ec1fd3a1","resolution":{"observed_at":"2026-08-16T00:09:18.206600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.210068Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.210068Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9ffcc487fe313f03a26b59581d73569abf7112eae07a6e4f625a3c5489b1fceb","observation_id":"9e8b2e84-e73c-4461-91c4-9bf00688c6d6","resolution":{"observed_at":"2026-08-16T00:09:18.210068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.214296Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.214296Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:67fdc4822d19b79465dd7159cbe3c2135d934d204b00e9a82cf7311333bc71fc","observation_id":"198ab2ef-01d2-41d7-923f-fb195d791173","resolution":{"observed_at":"2026-08-16T00:09:18.214296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.217495Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.217495Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f0469c4fe1964b62d5418d9581e3faf2f08cc4de43a9ca2f00e7ec16d36e0e96","observation_id":"790836ec-2a49-46b1-80d6-4ad9eb6be0a5","resolution":{"observed_at":"2026-08-16T00:09:18.217495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.221276Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.221276Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:ba058dae9b9cc3a1c2f4ffd265dd13b42412ce89a216fb159bffac15496fa888","observation_id":"e5373747-d872-4110-aa85-a96428c7291d","resolution":{"observed_at":"2026-08-16T00:09:18.221276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.225163Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.225163Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:c348e952ab2265584ca7a99f4219369063bfd90f8f5c24cd4018559eb79dec6a","observation_id":"0af7ddf2-e113-46d1-9b70-d2ab4e6bab68","resolution":{"observed_at":"2026-08-16T00:09:18.225163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.228795Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.228795Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:ea6c8635772cff57801e63727d18dccd9ca4cff5a92b4817a616435fc534ab91","observation_id":"a9b04ec1-e611-4fc4-9a3b-085206799bd3","resolution":{"observed_at":"2026-08-16T00:09:18.228795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.232127Z","title":"2024 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.232127Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:57ac7b45a4a1bb42474b820f0b6fbcc98157e588a88509e553c8bcab7af986d1","observation_id":"7c113b82-daa2-47f6-aabb-a6533ce590bc","resolution":{"observed_at":"2026-08-16T00:09:18.232127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.235430Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.235430Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:3b1c5abe450c5229837428d9cb7caaef50104734988073fd3c16add752cabc21","observation_id":"166969f3-0ec7-4d50-8c18-99cf64e4e238","resolution":{"observed_at":"2026-08-16T00:09:18.235430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.238598Z","title":"Visual Intelligence , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.238598Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:dcf752edecb0840eee92c207043d8a3ef3883cd4ef2a6d39aaceef5218120602","observation_id":"631494c5-6dca-4ca1-a8b1-6655b275f04d","resolution":{"observed_at":"2026-08-16T00:09:18.238598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.241956Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.241956Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:016b7f7411a92822dbee42ad72a6ba2fa0f7c898c8f582be8abf208a97746a86","observation_id":"dd53a003-ce60-4e95-b197-78914fbff2e7","resolution":{"observed_at":"2026-08-16T00:09:18.241956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.245336Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.245336Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:2c63d2196149ca9c680ad9eb03b6b11c02692adcfac5f33786b1f2d9f44a2b3e","observation_id":"a14fb8f5-6243-4fdc-85da-f6b0fde0383a","resolution":{"observed_at":"2026-08-16T00:09:18.245336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.248499Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.248499Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:5114bca156321c5546566530fc69d0d3ee6dd1b94016ac13c5512f859108caa6","observation_id":"24ddecf9-0999-43a8-b6dc-1a18525ae5f2","resolution":{"observed_at":"2026-08-16T00:09:18.248499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.252010Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.252010Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:42147abc120de38ff314249b3395f5dfe524ef7c85e61bdaef2d6c695323dc20","observation_id":"38806458-f364-4829-b4fb-fc5b09da3680","resolution":{"observed_at":"2026-08-16T00:09:18.252010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.255311Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.255311Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e4da95ec653313079eb785c7178ecb01892b317a156a097bb83f4728a005e8b9","observation_id":"47feca59-be9f-4838-aecf-0d40e502dc86","resolution":{"observed_at":"2026-08-16T00:09:18.255311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-16T00:09:18.259063Z","title":"arXiv preprint arXiv:2304.07193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.259063Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:36a952bc454ca74244dd4d1fbdf06fc8a13decf8d01fad03fec46cf67812d105","observation_id":"d0ff5c32-6006-4d1b-9c83-d82dc1017147","resolution":{"observed_at":"2026-08-16T00:09:18.259063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.266450Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.266450Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:c3e626516c0b82d356dd466c61451e34e9fa813caf0c628f2776feec359f3483","observation_id":"bbd3066d-cf2a-47a7-a5eb-dfda3484a6bf","resolution":{"observed_at":"2026-08-16T00:09:18.266450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-12T23:53:00.854564Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-16T00:09:18.269408Z","title":"arXiv preprint arXiv:2405.20985 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.269408Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e97dfa88070f16b41753e8ca87d7bec3735ca0c80bd0758215fc07a7170ad301","observation_id":"ff44c456-9f22-4a7d-8893-38d52e44efd7","resolution":{"observed_at":"2026-08-16T00:09:18.269408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-16T00:09:18.273874Z","title":"arXiv preprint arXiv:2404.16994 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.273874Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:8f5c1f1f825c6d99f4374bb83dcff6a4e74009ea007a0fa6b9ca1cbb1474b0cb","observation_id":"b413ac14-a37f-46c9-8167-fba1bd896f1f","resolution":{"observed_at":"2026-08-16T00:09:18.273874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01847","last_updated":"2016-09-24T01:58:59Z","snapshot_observed_at":"2026-08-14T21:53:59.472078Z","submitted_at":"2016-06-06T17:59:56Z","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01847","snapshot_observed_at":"2026-08-16T00:09:18.277272Z","title":"arXiv preprint arXiv:1606.01847 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.277272Z"},"links":{"cited_paper":"/paper/1606.01847","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7923ab76b09652ec7deb89c89c6e576c319d411b3eb520f8812bddea69f2013e","observation_id":"b8c98ffb-b1ff-4c18-a79d-eebcbcaeb8b9","resolution":{"observed_at":"2026-08-16T00:09:18.277272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.281345Z","title":"International Colloquium on Automata, Languages, and Programming , pages=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.281345Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:b1a4eff01dd34263d8be7b1b9550d138f6151e7499318e7d173f7f0aed9006f2","observation_id":"f1431835-d342-4cc3-88c2-5a7d44c75e60","resolution":{"observed_at":"2026-08-16T00:09:18.281345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.285481Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.285481Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4642fac6ca134114b1b054f03023ae4b171353e1fe26eb971be1bd3e5b382a28","observation_id":"ba2da6cd-5520-4f45-987b-2d330b2ec766","resolution":{"observed_at":"2026-08-16T00:09:18.285481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-08-14T20:45:55.731918Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-16T00:09:18.288993Z","title":"arXiv preprint arXiv:1707.07250 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.288993Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:649559037d6b17101695f51084ffbf934c6bcc8124d6c791be72ca0d53067a7c","observation_id":"3033de1b-51b1-4341-b512-1827915139ba","resolution":{"observed_at":"2026-08-16T00:09:18.288993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.292484Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.292484Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:37c0c3811135a468d25e203288cbd218264d78db982c1345e36dec2c9c2ca552","observation_id":"93cf72aa-8317-4099-b5b8-1fd6a6d3c3ac","resolution":{"observed_at":"2026-08-16T00:09:18.292484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-16T00:09:18.295725Z","title":"arXiv preprint arXiv:2305.13245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.295725Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:c4034e30fd494ace8e9f2e77ee1ade0b50884af26a81f46814846d7220a28490","observation_id":"862e57a0-a390-4f67-8b7e-6b008c20bb70","resolution":{"observed_at":"2026-08-16T00:09:18.295725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-16T00:09:18.299513Z","title":"arXiv preprint arXiv:1911.02150 , year=","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.299513Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:adaf8d5059ed8492637d267a2360a0dfac2552d4a11ff29ba02ad87d310ff9f2","observation_id":"d13c8183-9b69-418d-9ef0-3948308fe9d1","resolution":{"observed_at":"2026-08-16T00:09:18.299513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.303079Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.303079Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:55f7bf3c2cfe6805793f2d3a13593558b1449b362df744905a4aed1b8f7af238","observation_id":"b342f152-1b0d-45bf-8ac5-deeb7ca75eeb","resolution":{"observed_at":"2026-08-16T00:09:18.303079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-14T12:12:43.486524Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-16T00:09:18.306273Z","title":"arXiv preprint arXiv:1908.07490 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.306273Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d6bf6d4cbc72f242332779a16c593b99749e3f8d4f8d84079d795abcfbb99814","observation_id":"aeb73f93-bd3a-49a8-88a1-8b5313b2fb04","resolution":{"observed_at":"2026-08-16T00:09:18.306273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.309435Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.309435Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:978dd52fcc985c6d30f61b27d7686e445ce6a52a2225bf92cfd9354cd772b0e6","observation_id":"58aa6810-536d-42ef-8104-bda0302ae315","resolution":{"observed_at":"2026-08-16T00:09:18.309435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.313282Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.313282Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a1b92268196feb3869e640486a004f35db410207f74f2688f0abb46d7ea1265a","observation_id":"20c76a08-459a-4705-bf22-b9973526bb4c","resolution":{"observed_at":"2026-08-16T00:09:18.313282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.316532Z","title":"Scientific reports , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.316532Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:fb27fd9877eab7d3b49d9cca8ff3aa2431637e5c8d962b881fe72c6bf7e95727","observation_id":"5c05fb9c-087a-4a51-a5f0-11564571a76e","resolution":{"observed_at":"2026-08-16T00:09:18.316532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.320625Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.320625Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:c041f3b6fa6fae5c2bf95d328c2a1d7cef357ccefc0ee8133800587399a59015","observation_id":"434536f2-3d05-492c-9ff9-c499cacfbf0f","resolution":{"observed_at":"2026-08-16T00:09:18.320625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.324123Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.324123Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:adb9a1d16fd14c50d51e74cecbfa2773b1deb8ff5c5cfa79d2b96759f5b0f6d1","observation_id":"20aeb9fc-85c8-4089-b7b9-e16e7c68811d","resolution":{"observed_at":"2026-08-16T00:09:18.324123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T00:09:18.327291Z","title":"arXiv preprint arXiv:2312.00752 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.327291Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:887c5c4e9d6c714719bf7c766b7d594d739d172ac045dc3baef052728e4f1ca4","observation_id":"4f1fd045-68ac-451c-992e-7c6c08929aa8","resolution":{"observed_at":"2026-08-16T00:09:18.327291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-16T00:09:18.330658Z","title":"arXiv preprint arXiv:2307.08621 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.330658Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:fe0000ee1da372cc25f7df9ad6949d72d275b50164035b5d99eafc0da8756b9d","observation_id":"fe591112-dc85-4e93-b70f-bc762eb20c72","resolution":{"observed_at":"2026-08-16T00:09:18.330658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-16T00:09:18.334068Z","title":"arXiv preprint arXiv:2305.13048 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.334068Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:aa03624a5c6c61054e35fd2dae929fc2700fa1f0e5213f77001e5cd3731dcf56","observation_id":"834b29cc-6fe3-49c8-a74f-c1a1d8b1ec3d","resolution":{"observed_at":"2026-08-16T00:09:18.334068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-08-14T00:11:56.379317Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06457","snapshot_observed_at":"2026-08-16T00:09:18.338225Z","title":"arXiv preprint arXiv:2507.06457 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.338225Z"},"links":{"cited_paper":"/paper/2507.06457","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:92225f58ec17d9d29f71333897e2beed96e5c6f84c56c076a5421ac19090b33b","observation_id":"037c8e0f-fe59-4ff0-89cc-69a691be0dea","resolution":{"observed_at":"2026-08-16T00:09:18.338225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T00:09:18.342324Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.342324Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f56bb356f56ee5d492c1ae1bb26eb9ce15a7c04a3c68960f0003a3db1827fb37","observation_id":"b631e196-28cc-4f9c-b96d-fe9e23d8d46b","resolution":{"observed_at":"2026-08-16T00:09:18.342324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.345488Z","title":"IEEE Transactions on Knowledge and Data Engineering , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.345488Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:edb70389d00aaed30605388ee243b7f06de877d03a5d415478f9fc2689084e37","observation_id":"0be8a52b-9bda-4cc7-bec2-dc520ed3ac70","resolution":{"observed_at":"2026-08-16T00:09:18.345488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06670","last_updated":"2019-02-22T18:38:15Z","snapshot_observed_at":"2026-08-14T18:39:08.324821Z","submitted_at":"2018-08-20T19:52:51Z","title":"Learning deep representations by mutual information estimation and maximization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06670","snapshot_observed_at":"2026-08-16T00:09:18.348668Z","title":"arXiv preprint arXiv:1808.06670 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.348668Z"},"links":{"cited_paper":"/paper/1808.06670","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:0d1c82342acf32e9a4f36db5c30f701a5cfcff1c4042c17f9501a9966fa0ab53","observation_id":"ae418849-8255-46b7-b87d-7f14f0bec818","resolution":{"observed_at":"2026-08-16T00:09:18.348668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.352825Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.352825Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7e7deb80a96a875d750f3d386759b2ee8e12a60c732fec2cd6496df3d6560c21","observation_id":"173da82d-718b-401c-ba00-c9b11063f096","resolution":{"observed_at":"2026-08-16T00:09:18.352825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15352","last_updated":"2025-06-09T08:05:39Z","snapshot_observed_at":"2026-08-16T12:48:33.050429Z","submitted_at":"2025-03-19T15:51:17Z","title":"Towards Achieving Perfect Multimodal Alignment","version":2},"cited_work":{"arxiv_id":"2503.15352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15352","snapshot_observed_at":"2026-08-16T00:09:20.148078Z","title":"Towards Achieving Perfect Multimodal Alignment","venue":"cs.LG","work_id":"b5ff28e9-756f-4ff4-9d76-981309422d40","year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.356102Z"},"links":{"cited_paper":"/paper/2503.15352","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:25de41e0d820416a1a4edafd1d30496d35727ee562480ceb1b345753ef28cdc5","observation_id":"c8d034c2-0382-4b57-95fc-bebd575fd027","resolution":{"observed_at":"2026-08-16T00:09:20.152184Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16832","last_updated":"2024-07-21T18:11:34Z","snapshot_observed_at":"2026-08-15T14:59:35.339217Z","submitted_at":"2024-02-26T18:56:48Z","title":"Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16832","snapshot_observed_at":"2026-08-16T00:09:18.359522Z","title":"arXiv preprint arXiv:2402.16832 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.359522Z"},"links":{"cited_paper":"/paper/2402.16832","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:0b63cd6faa3cd2573b9fa914c7d77776fdd6a224d21ff7f394dcbc0c216f4925","observation_id":"94bcdb0f-c482-477f-bbbd-02555ecee220","resolution":{"observed_at":"2026-08-16T00:09:18.359522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.362682Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.362682Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:3c104fdcd5289e35368191356252e111bac2388232e5071879a009d01023aef0","observation_id":"6cddadf8-7db4-4e33-b6a6-4492a9084913","resolution":{"observed_at":"2026-08-16T00:09:18.362682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.366327Z","title":"IEEE Transactions on Visualization and Computer Graphics , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.366327Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:42f5e307b33e65b763a47a5e26e0e8ca585bf6f6f8f6383732bdb862d0daa1b8","observation_id":"d0c07504-d2c5-4e3e-8e0b-66e28e7418a5","resolution":{"observed_at":"2026-08-16T00:09:18.366327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.370409Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.370409Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4ce49f9d6d794e2468eda94f258521c55d80a6420caa904408ad0948d07dde24","observation_id":"294af071-c99c-47f8-9fba-cfcf71802ec3","resolution":{"observed_at":"2026-08-16T00:09:18.370409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02875","last_updated":"2024-08-05T14:01:26Z","snapshot_observed_at":"2026-08-16T10:35:02.925791Z","submitted_at":"2024-03-05T11:38:48Z","title":"Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples","version":2},"cited_work":{"arxiv_id":"2403.02875","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02875","snapshot_observed_at":"2026-08-16T00:09:20.129397Z","title":"Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples","venue":"cs.CV","work_id":"0b069419-d4d7-4ba0-b581-be32b06dc7ea","year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.375123Z"},"links":{"cited_paper":"/paper/2403.02875","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:1d3721f2bd307a0b694190a975b8e147d052735e46e23d16889391679fd7c7c0","observation_id":"76608d80-5443-43ae-a212-acd4d5b81c2b","resolution":{"observed_at":"2026-08-16T00:09:20.132947Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.378889Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.378889Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:99b47616b00c2de70ea2c0e865f41fa740c118427e38046364446801382bb5f4","observation_id":"3663de83-66cc-40f6-80e1-6fc00da5e1fa","resolution":{"observed_at":"2026-08-16T00:09:18.378889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.382502Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.382502Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:43f07d74ab39156d84d643d1bf7075e645afb13e836576a454bbc7f95850fdae","observation_id":"9a27dc3a-387a-424d-80b6-d1842df26b8f","resolution":{"observed_at":"2026-08-16T00:09:18.382502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-16T00:09:18.386507Z","title":"arXiv preprint arXiv:1807.03748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.386507Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a2b97f3d55529a948a40ff8f5330e014c2e5c201b994ded3b468d33ba910a830","observation_id":"582bd7ee-ebb1-42f8-9fe3-c54da476fd65","resolution":{"observed_at":"2026-08-16T00:09:18.386507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T00:09:18.390945Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.390945Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:bbf346ec0565be0e62fdcad508a0304a75b7acae07db760f7cc337aa248aac89","observation_id":"3f693ce0-b55d-4375-ace4-aff1f1285ad5","resolution":{"observed_at":"2026-08-16T00:09:18.390945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.394896Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.394896Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:15d6128272ffdb0a1b684e71456ad529084a07957edbe5d8687064c7ae5c6cc6","observation_id":"807fff39-ebf6-415e-8287-d348b5d9300c","resolution":{"observed_at":"2026-08-16T00:09:18.394896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-15T14:49:08.287205Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-16T00:09:18.398783Z","title":"arXiv preprint arXiv:2004.00849 , year=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.398783Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:5965bd26bb5dd8d278e27c3bc0f169aa52cac5734a2bf1ce6f0094768d598b6d","observation_id":"84c5ce49-402f-46c9-a776-285a972c0e64","resolution":{"observed_at":"2026-08-16T00:09:18.398783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14347","last_updated":"2025-05-15T15:52:39Z","snapshot_observed_at":"2026-08-15T15:42:34.420849Z","submitted_at":"2024-11-21T17:42:20Z","title":"DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14347","snapshot_observed_at":"2026-08-16T00:09:18.403553Z","title":"arXiv preprint arXiv:2411.14347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.403553Z"},"links":{"cited_paper":"/paper/2411.14347","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:09c3d4e53b18d53e87c954c1d634c79fb8575b55cf10db346a0ec828ff9c96d0","observation_id":"c6fa70a8-fc79-469b-963b-e9ce45a69b42","resolution":{"observed_at":"2026-08-16T00:09:18.403553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-13T00:27:10.979145Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-16T00:09:18.407130Z","title":"arXiv preprint arXiv:2405.10300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.407130Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9ae17a28a2443f25e2f45fc0cb3491166e2ea1eb9b14c62587cba19eef17e92d","observation_id":"61759e2c-5b3e-42ff-a09e-69345ff19fa6","resolution":{"observed_at":"2026-08-16T00:09:18.407130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.410782Z","title":"arXiv preprint arXiv:2503.07465 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.410782Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d9f222e8b910847a7c9f3ad9913ec3590ea9999c75c5800f40da629788a118d7","observation_id":"f235c6f8-8702-4b7f-a42a-dd3fdcfcf2b1","resolution":{"observed_at":"2026-08-16T00:09:18.410782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.414921Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.414921Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9368f59f656a71e28f88fa141de35cc3cd222395a8fed51f7f6123696819e5dd","observation_id":"757268e6-1c12-4301-ad2b-0de76dddf4d6","resolution":{"observed_at":"2026-08-16T00:09:18.414921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.418075Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.418075Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:b63fbd5d6731cd023777b35804d67860b69ad19498a68bbde5097775e7a8d229","observation_id":"f442bf30-05d6-41d0-ab8f-0d770b481288","resolution":{"observed_at":"2026-08-16T00:09:18.418075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.421565Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.421565Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d79d80d14960b21197e9cd674f50d082864454b746630dfa235e50f3af52a224","observation_id":"4a822874-dff6-4f9a-9e56-ec55b0e4d893","resolution":{"observed_at":"2026-08-16T00:09:18.421565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.424416Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.424416Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7dd5945d02fde9d8a2968a84b12125ed2b2db8f35bf0e69720be326e9aa43bfa","observation_id":"e908ccd2-a150-485d-bceb-743d546d6521","resolution":{"observed_at":"2026-08-16T00:09:18.424416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.427521Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.427521Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:6f7ff18d8e12eb8c32c0699945b724f7f324c04cf304687ce945e44c4b8ad7ab","observation_id":"94186c65-14e1-4ef6-9934-bd93689fb394","resolution":{"observed_at":"2026-08-16T00:09:18.427521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-16T00:09:18.431661Z","title":"arXiv preprint arXiv:2104.13921 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.431661Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:84a584ac4a9b5641796b8a4dcd21ed2c3b577e329a288c6ecf682f8ee8c58a9d","observation_id":"b545fd16-3ec7-416e-9ce4-00c77ae285a1","resolution":{"observed_at":"2026-08-16T00:09:18.431661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.435447Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.435447Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:362be2316e296dd1a5db7baea187d82441998a491e4c48f483064df50d3a6700","observation_id":"3e262bb6-28bc-4f79-872e-2f0e029ba1dd","resolution":{"observed_at":"2026-08-16T00:09:18.435447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.439386Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.439386Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:2953c515bc122ff0748d90f293425d90f24258da5dbf9d51e0444780bff8934b","observation_id":"aa95a6b9-2d9d-4569-9f10-9f499d54cb9f","resolution":{"observed_at":"2026-08-16T00:09:18.439386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.443344Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.443344Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9c55f271683148927dd487dfe5f51b85fe80ca628d9102ab685145ef627dc692","observation_id":"16e0af0a-7474-46f1-97c5-a6ce637d7988","resolution":{"observed_at":"2026-08-16T00:09:18.443344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-16T00:09:18.447397Z","title":"arXiv preprint arXiv:2505.20279 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.447397Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a9fb362c925f9de0a620cad511e526a9926cca7350a4f20797777615de6c89d0","observation_id":"58e84b30-1e5e-4bfc-82ff-4a46363cabb2","resolution":{"observed_at":"2026-08-16T00:09:18.447397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-14T21:31:53.057652Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-08-16T00:09:18.451539Z","title":"arXiv preprint arXiv:2509.07295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.451539Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:dfb572e5d556cf0357c981e773e0b9172a4ab9c857f23ac70cd0414c240fa44f","observation_id":"fa101d85-636c-47f0-9dc6-9f4878968d35","resolution":{"observed_at":"2026-08-16T00:09:18.451539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-08-16T13:10:02.146064Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-16T00:09:18.454827Z","title":"arXiv preprint arXiv:2410.09575 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.454827Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9526257325f01513a574927fc58a467be63d30bb2f842bdb7991bcbf6707ce68","observation_id":"c4606724-0164-4c2d-921f-7e9932cb4b89","resolution":{"observed_at":"2026-08-16T00:09:18.454827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.458692Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.458692Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:fefdc5ccd8ae513feaedc7df7847bf3b43c7b3e1bd33f4cad031e880212db8e6","observation_id":"b9059908-295c-4d50-99aa-3e19fd988604","resolution":{"observed_at":"2026-08-16T00:09:18.458692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.462406Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.462406Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:cb92962572306f0e1ef9ce674a4f30f5da8c905c12fe320b41ec36c190927927","observation_id":"b044f2a9-f4b1-4c70-bb86-18d3710013ed","resolution":{"observed_at":"2026-08-16T00:09:18.462406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08381","last_updated":"2024-03-10T19:00:00Z","snapshot_observed_at":"2026-08-13T05:50:35.656851Z","submitted_at":"2023-10-12T14:55:31Z","title":"AutoVP: An Automated Visual Prompting Framework and Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08381","snapshot_observed_at":"2026-08-16T00:09:18.465655Z","title":"arXiv preprint arXiv:2310.08381 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.465655Z"},"links":{"cited_paper":"/paper/2310.08381","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:71c948c41c341a8484309af3a360f59286af2214f3ca6bc16e1dd8ec9e134696","observation_id":"2305c43d-1a7b-475a-bb5b-92fcffeac25e","resolution":{"observed_at":"2026-08-16T00:09:18.465655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.468974Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.468974Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:88ca41bbcae83233e1fd246f018e4819301710c4fe6befea6f06f1948cb65729","observation_id":"2098a7e2-3c1e-42b0-ad3d-8915e61b50df","resolution":{"observed_at":"2026-08-16T00:09:18.468974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-14T03:15:48.310538Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-16T00:09:18.472945Z","title":"arXiv preprint arXiv:2203.17274 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.472945Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:929272b74fb73d611abba126b56cb7e6f7b1ade95a1f31432c6b08f1d77a340f","observation_id":"5a7ef476-59b4-47a5-a3ba-43babdb96744","resolution":{"observed_at":"2026-08-16T00:09:18.472945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.477311Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.477311Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e8278b3e6a15c161147adfcb29d385fa9c9668cf3535a592fba42dca5b58a79d","observation_id":"7b18dd3c-38af-4f9b-a832-10a6e057418e","resolution":{"observed_at":"2026-08-16T00:09:18.477311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.480340Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.480340Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9efe725809fcacd6a5b4a919bb31799bda412e53755f12011ce07c8b358717b4","observation_id":"6b4b153e-f91d-494f-b8b1-5e528e43d0a3","resolution":{"observed_at":"2026-08-16T00:09:18.480340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-16T00:09:18.483633Z","title":"arXiv preprint arXiv:2101.00190 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.483633Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a28797f14a5b57a8071ac3a0212cc128323ba943c5352ba97cf2165b118bf4da","observation_id":"35dfea57-56f9-4d8f-a039-9ece697abcb4","resolution":{"observed_at":"2026-08-16T00:09:18.483633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-16T00:09:18.487512Z","title":"arXiv preprint arXiv:2104.08691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.487512Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e9e7d6f12abd389e3e79df1fb6b00fd7a90259c602a68db3cca804ecdcaaf893","observation_id":"431e6702-d31f-4fcf-be6d-7a75c5fa7469","resolution":{"observed_at":"2026-08-16T00:09:18.487512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-14T08:27:33.738990Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-16T00:09:18.491464Z","title":"arXiv preprint arXiv:2110.07602 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.491464Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:42fddf787efdab29548c95d4e5ed172a0837163db67d0e4c19eb03a3f1b5a061","observation_id":"c7c9fe7d-7655-4784-8ee2-dc942b7961f6","resolution":{"observed_at":"2026-08-16T00:09:18.491464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.495392Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.495392Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:2b6dba42d6c036f106482f00ef94ca46abd1d84d434d7adf62cd911b61fd700b","observation_id":"e587b3c4-fedd-4f32-9535-011c1aad0ba1","resolution":{"observed_at":"2026-08-16T00:09:18.495392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:10:46.462002Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":98,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":287},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 287 outbound references and 0 inbound Pith citation observations for arXiv:2608.12748."}