{"as_of":"2026-08-06T15:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1a1e75a544a776d3e5316768b800cc0bd026687240902d8216b10f239bbf6af","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:00:24.297044Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.02168/citation-record","integrity":"/paper/2606.02168/integrity","json":"/paper/2606.02168/citation-record.json","paper":"/paper/2606.02168"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:56cf206414a9f5673ed20d81556de039a1d82fb47bcc5999d3310bcece6b0e58","observation_id":"9f695afd-c87c-47b1-9790-c4df90d71020","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:2f413adfe1d1a4877886f3480461e2333d2b94f07ef51219663ad1ad87c1be0c","observation_id":"4457f8f5-fbf4-4ffa-9dba-0e57cc100178","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Image as a foreign language: Beit pretraining for vision and vision-language tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:5c9b383c1003da95f8dc6cb5e21c2f1465d20164933c849246bc4b78599cc99b","observation_id":"3c1bc5aa-0459-450a-8f87-2c13003ec651","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Connectionism and cognitive archi- tecture: A critical analysis,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:c055fd96be4978320fab25eef41e2a1fe68463b95aff0a4b4772f8ef720890da","observation_id":"c1ee886b-4cb1-456b-a3a8-0f302ee759f9","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12889","last_updated":"2019-04-21T15:37:46Z","snapshot_observed_at":"2026-08-02T10:43:43.472315Z","submitted_at":"2018-11-30T17:01:28Z","title":"Systematic Generalization: What Is Required and Can It Be Learned?","version":3},"cited_work":{"arxiv_id":"1811.12889","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.12889","snapshot_observed_at":"2026-07-04T21:00:08.394167Z","title":"Systematic Generalization: What Is Required and Can It Be Learned?","venue":"cs.CL","work_id":"43c4bd82-57c8-4d3e-8e94-66ae1ffab8f3","year":2018},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1811.12889","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:a3f0941be690714f119c5093264f8ce7c436ba46f9599e557f4ccde75f12f7b8","observation_id":"65222092-fd15-40b3-b9b4-9701a8da8b92","resolution":{"observed_at":"2026-07-01T22:46:20.198556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05783","last_updated":"2020-10-17T23:58:06Z","snapshot_observed_at":"2026-07-06T08:43:58.019943Z","submitted_at":"2019-12-12T05:56:53Z","title":"CLOSURE: Assessing Systematic Generalization of CLEVR Models","version":2},"cited_work":{"arxiv_id":"1912.05783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.05783","snapshot_observed_at":"2026-07-01T22:46:20.204067Z","title":"Closure: Assessing systematic general- ization of clevr models.arXiv preprint arXiv:1912.05783","venue":null,"work_id":"5699cb83-ad40-4d2e-b030-0821a7c58635","year":1912},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1912.05783","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:3ca0ae0a07e8d1083c84a33102b2895590c7e5b6aac9344619304ef149a5abe8","observation_id":"0b607505-1732-4b83-8733-8c91f2a66987","resolution":{"observed_at":"2026-07-01T22:46:20.206113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"A benchmark for systematic generalization in grounded language under- standing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:398443ba5dd88db25bf4985a8d98fc4b283344ebf30505dc59f60506a13d9f3d","observation_id":"b87c9b17-dd30-4251-9545-19d00601e586","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"How modular should neural module networks be for systematic generalization?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:64eeae893c062e595297e4f3f8c9ed9f323022d23a26ef45734e4b0ecfa88c22","observation_id":"fba93d66-587b-4ac7-8b74-f3c11a71e192","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Meta module network for compositional visual reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:640df6bc4b19858dabdc6255a0eff7900b8ba278725e26a916e1354e809d519e","observation_id":"1c7b0d6e-87c1-44d3-bb8d-6be96d409160","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Transformer module networks for systematic generalization in visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:a4f34d131759b8282d6f57922070f186701ae24062164b651cc8fbe90ab3d966","observation_id":"6e449ac8-373b-4afc-9fa4-e73261789a87","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Detection-based intermediate supervision for visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:d6bec20ca19e32016560e632bd9dc8fb594d75566370b604a569039de3fa9992","observation_id":"1f084baa-277c-4598-b2a3-30da671d3a4c","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Neural module networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:61ab5df82f6a3f263eb8e017fcd78c8b3dc93d2211d3b67ccec63c265357b51a","observation_id":"0c74a796-66f4-498b-ac7a-6f43f7c3d3ac","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Linguistically routing capsule network for out-of-distribution visual question answering,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:7f51f6b04fe070f935e8e0bdd45b5b511307c4995709bfbb8b281f01e9c5503f","observation_id":"f0bc193f-b735-4ab7-90fd-2ebbef8c892d","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Neural- symbolic vqa: Disentangling reasoning from vision and language under- standing,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:dbac7efa1f8cdec10d5f578a3eaa9dc0c002da5563447b8d157ec61b6ccda831","observation_id":"c5b9e607-d1ae-4257-a2bd-0af933afc54f","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Multimodal graph networks for composi- tional generalization in visual question answering,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:571a4da6a444463041979c5dd43f7f4e7ae75c0c86dd078a02ad22a68e89e5e5","observation_id":"01199c1f-7d17-4ae4-b218-63bd8eb946f5","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Compositional generalization in neuro- symbolic visual question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:92259917f16b81306d378bf238bbd5fc33123b03460df8fba98a9379ece76460","observation_id":"c76e7700-179c-495c-8ed8-f954ff50c167","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:265907579637699c0661427d7253453707bde6e15baae59332ea762e1e92d5c3","observation_id":"e8765eb5-b42d-491a-9752-cb6f5dfccc1c","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Exploring the effect of primitives for compositional generalization in vision-and-language,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:477e2a8688303a69965f2a47dd3df61d94de32c87d182bf2bd10961d243c3a64","observation_id":"e75fec6e-a4a2-425b-bcfe-8bf105aa7729","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02230","last_updated":"2018-12-05T21:21:09Z","snapshot_observed_at":"2026-07-06T07:19:25.218264Z","submitted_at":"2018-12-05T21:21:09Z","title":"Towards a Definition of Disentangled Representations","version":1},"cited_work":{"arxiv_id":"1812.02230","doi":"10.48550/arxiv.1812.02230","metadata_source":"pith","pith_arxiv_id":"1812.02230","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards a Definition of Disentangled Representations","venue":"cs.LG","work_id":"4eed7fba-5346-421b-b253-a5e119d37dc2","year":2018},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1812.02230","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:fe0e3c30899f64a6daf59ee4b6a06aeb943cce175485788233f700765ff394a2","observation_id":"ebd91367-320c-487d-a84d-184ccc174617","resolution":{"observed_at":"2026-07-01T22:46:20.190915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Causal inference in statistics: An overview,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:52c74f6a3f2d0ad1d99e94013cf940bcd478306ec2ebd60c35627bd70038dec2","observation_id":"b7b3ef2f-a364-4b1b-bfd4-67041aa338ff","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Group equivariant convolutional networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:37eb98422022b7ca2f59c5bdc25aa0b77655b8f9480080838066aef97be42a4c","observation_id":"258d9ccf-cc4c-44de-b1b1-18147eb74029","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Mutan: Multi- modal tucker fusion for visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:036c3cd85ce0bbe1ffd2afffdaedbb4136a8cf7bb0259c5f4a4c63c60948ab5a","observation_id":"a41f3597-08c7-4efc-8e0a-7316e03724d7","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Joint embedding vqa model based on dynamic word vector,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:169f53cd0855bafa0fe29779dcdadac14038c3e768f8b1f7afc0738058c09869","observation_id":"eb009872-6290-49f3-8e1a-e7ddef126de4","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Where to look: Focus regions for visual question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:84d113551b3d069b1e6240db0dda17306ef982a846efefa1d493e43dd6c6dcd4","observation_id":"01a0301e-1ca1-4e54-9a71-b08348506c9e","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12584","last_updated":"2019-04-26T06:50:54Z","snapshot_observed_at":"2026-07-06T07:49:09.822610Z","submitted_at":"2019-04-26T06:50:54Z","title":"The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision","version":1},"cited_work":{"arxiv_id":"1904.12584","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.12584","snapshot_observed_at":"2026-07-04T16:29:57.717558Z","title":"The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision","venue":"cs.CV","work_id":"d6397740-c5de-4292-9823-00d99a6d8398","year":2019},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1904.12584","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:86d27b343d06caa777af0996eb9b716d279dcf4e44c09774a7edc45c50b71bd3","observation_id":"ca384247-0ec2-4078-9424-34498047a0bb","resolution":{"observed_at":"2026-07-01T22:46:20.194421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Visual question answering with dense inter-and intra-modality interactions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:f2a22afc1c9a60792e3ff0fe371fbbc40de96b184baac50cf73fa45b9e3d8f12","observation_id":"d47d5ad8-33a3-4fe5-8afe-92d825fb68f7","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:bfecb5accb5c57c3765c7a6da257f970e4eb0515e7c3f5020e85248e565f36e8","observation_id":"3cc4150e-e47b-4b05-99e9-0b3c88ffdd9c","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-06T03:44:36.669916Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":"1908.07490","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-07-11T00:37:42.291267Z","title":"Lxmert: Learning cross- modality encoder representations from transformers","venue":"cs.CL","work_id":"a328317e-ee7d-44a5-b290-dbafa77f31f7","year":2019},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:b904cbf9e095acb79af6edd7007008b73653ece4920d43375d4477f5d1f5eae8","observation_id":"6dd99fb5-5bb4-45b4-9e2a-353802844ec5","resolution":{"observed_at":"2026-07-01T22:46:20.180376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Boosting generic visual-linguistic representation with dynamic contexts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:d570658da6c94cab87bae2197915c26d4fd91d2f0b4abbe9f621fa363dea48aa","observation_id":"80c0c08e-dfbc-43c6-b4ca-4ff972963b9f","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-07-06T17:20:00.101661Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":"2401.13601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-07-04T15:09:55.103963Z","title":"Mm-llms: Recent ad- vances in multimodal large language models","venue":null,"work_id":"4c35990c-f0e6-4be5-bdd6-e77e3eaddf23","year":2024},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:725f0472d1b6c85ae1bdfc02dff5e626c3296fbd8f69f626809b3c6e5d052dc1","observation_id":"335dc2dc-8591-4188-bb68-ed35c7241019","resolution":{"observed_at":"2026-07-01T22:46:20.183807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Exploring compositional generalization of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:b82b74a9143361b2232d9e770b80c49773a3a790d7e93b14c5941504f660fdbe","observation_id":"6e5f3483-d568-407b-ba10-ce9cfc691609","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Learning, reasoning, and compositional gen- eralisation in multimodal language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:28b7e383ea5052bfac063302afa2bae00f1a3d59e4abee2a0a536e07723fd6dc","observation_id":"a192a7dd-0f1a-4b78-b1b1-3f3de31dfc57","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:dfd92d2b475fc91f6301adaf6481bdf44f7501c960fa4956bdf9c37f6577b335","observation_id":"b00e832f-6212-4d6e-9ca0-fd58ecdc653f","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Learning to supervise knowledge retrieval over a tree structure for visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:07a07b300b6ed44da008cd99d914ede97c43df6156bc3decf08cf47426abc626","observation_id":"9d935252-7e24-42eb-8709-040f78080aae","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Towards causal vqa: Revealing and reducing spurious correlations by invariant and covariant semantic editing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:0a38b6d438c04f75e04b8b482892be398333cbb6be34a61c7b7a5216f396054d","observation_id":"63888886-6f4c-493d-9d62-95357b596296","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:d13a03b8e43a4e975c92c2a45f83dc39997d994214a19c9c5180b8733bf6adea","observation_id":"5aafe7d4-7a87-42d1-94a2-89fbb2739e45","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Transparency by design: Closing the gap between performance and interpretability in visual reasoning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:cf56063b41f979d074602bb84d26b5cf5525e1ceb4b28e87fefe4db4826e7c31","observation_id":"da6f634c-78ca-46de-b677-f820a9c6c336","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Lexsym: Compositionality as lexical symmetry,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:ba721d5ccc8d2f05e103d926445272bf623075655cb80ea93c53bfc63249166b","observation_id":"53ac0129-d8e0-4012-aae4-6eb949a2eef0","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:abc93ec246d6ac9ca6569c165159e3d5d091b28bbb0054136a1ba7eac881c157","observation_id":"dc064c12-6695-4991-9407-44541884bcef","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Disentangled representation learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:c21df7af803cda6830de1202b9ab5aa6156394bf5d2b18b38843812bbdf4c263","observation_id":"86af0957-9e41-46cb-a8e0-c02afd9b4751","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Robustly disentangled causal mechanisms: Validating deep representations for interventional robustness,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:8b402cf90ca22be579c23d11c4fdc74c5220c0ca350f493a6746d7677bfb6f51","observation_id":"53d9498d-4e46-4b55-991e-7c966ce6c30b","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"On causally disentangled representations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:190d8f19f7b54c26c0f662a1b63caac3572ba801f62605cb6dd01b58cad3b716","observation_id":"61ccfafb-9bd2-4675-9ce4-a8b312d830b3","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6437.2021","doi":"10.1109/cvpr46437.2021.00033","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Derf: Decomposed radiance fields","venue":null,"work_id":"7083a41e-5666-435b-ab26-c753f6490b9a","year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:9584c1e98a3a17d4ed1185556bb50e5ef417940583c4cfadbc8de0070ccb6645","observation_id":"96a10e15-d4bd-4f1f-bbfc-153104aee8a8","resolution":{"observed_at":"2026-06-28T15:02:18.383830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"A meta-transfer objective for learning to disentangle causal mechanisms,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:f8d7d25ba86aa7449de04683ef923da8be148d622a3c2c31e99816c6a3d336ac","observation_id":"8341495a-bedf-4f62-b050-9cf983060fe9","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Disen- tangled generative causal representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:34b7efcd1bdb12e6be208db5c628791e70e0b5a16713795c580c141c3bc9b1e3","observation_id":"0ca05e7a-8be0-41c9-bead-4de496e65a48","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Equivariant flows: Exact likeli- hood generative learning for symmetric densities,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:2d281f43405c065905a4571b0a6fa6211d57a8e20edf589bda6852a03c77acdf","observation_id":"30fb5c3b-0d91-4263-84d5-8caf94e14969","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Group equivariant capsule networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:94240dbbf0234b7240e26ffd110107cadb5f7022960cabcc2927e54ccfe01760","observation_id":"56c8af20-d85e-4e30-8c9c-b5b6c7797425","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Learning generalized transformation equivariant representations via autoencoding transforma- tions,","venue":null,"work_id":null,"year":2045},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:e8f058b1b71aa615cc7d93d7f9ace5f4f364bf0fd3051f46ab16d49acd50e348","observation_id":"d4302c82-8bac-44fc-82b1-60650abac4f1","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Equivariant and invariant grounding for video question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:9d40041f144322d94360e11a39df3299e57319ba8b428fcd347a0d77326bd5e0","observation_id":"16cd8704-c1fd-4a72-8d9a-a44a1b2d5715","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:76c80b8c4c213a5f885efe8cb749e36460510c8c4acf9e872ed68de4b32171b6","observation_id":"fa544d7f-30fb-4361-b3f8-1fb9263dc572","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02893","last_updated":"2020-03-27T19:07:58Z","snapshot_observed_at":"2026-07-06T08:05:24.076802Z","submitted_at":"2019-07-05T15:26:26Z","title":"Invariant Risk Minimization","version":3},"cited_work":{"arxiv_id":"1907.02893","doi":"10.1038/s41591-023-02608-w","metadata_source":"pith","pith_arxiv_id":"1907.02893","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Invariant Risk Minimization","venue":"stat.ML","work_id":"d76c6842-b84d-44ec-bcea-b80cd8d07981","year":2019},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1907.02893","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:a187ee07c91a8391763bb878358362d0aef44862cf0502a71d297de8b88a1860","observation_id":"9881197d-0f97-43aa-b7d6-4aeea8839f8f","resolution":{"observed_at":"2026-07-01T22:46:20.186924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:fc6c0c98a5a8f6fed78a3efed44cae9d35ee38801efd7de11745fbfe102e4895","observation_id":"637be5b8-5187-4b19-8d72-d63f0f60b91d","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:cc7d3f606ec723682cccc518c424f5867ae32b9bf1ecb4e2eb935ae26f9c6508","observation_id":"a7d0607d-2664-4545-848c-4946f2a69d3d","resolution":{"observed_at":"2026-07-01T22:46:20.201937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:8821e388e3747717d444a78c3fdf07d306aa902b80761da97d2105e50d03b9fb","observation_id":"c2c2093a-fb46-4478-8693-e3d95e68f4d4","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:a5475a026ecd6d211553c8b3f2043880249b2e9b15f95e511eb849eb4cefdfe3","observation_id":"ddaeb4a4-9767-4c97-aae1-6ce792e38b79","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:3fa535fe1c492bf83f57422a76836e06b25d34c22b3fa5abc2dd6030b65c5d98","observation_id":"b193d3b6-e1ac-4ae8-885a-a4a28387502f","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:7e8e3e99c3eec7742234e9e708af0d2807a97e888c012728881eb462a611a533","observation_id":"afa23648-02e5-42d1-b46c-f31b83374864","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-10602-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T","venue":"Lecture notes in computer science","work_id":"38d1256f-0d29-4961-bfef-fc772f802fe7","year":2025},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:34e2722615119acfa040936da5a4db5b2b37f693af1200eaf512858f25dba7d3","observation_id":"33fd2797-4764-4720-9ee9-d266fa796a1b","resolution":{"observed_at":"2026-06-28T15:02:18.386214Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.25028+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.25028+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:30ed24bcddefb4041ef0567f5941e8dd9370f8461d79cfce26989fe7a2860592","observation_id":"41daf745-af95-48c6-a5bd-5de2f9c9c2e8","resolution":{"observed_at":"2026-07-01T22:46:20.176301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:2575afdd8b5353d45d0b565285e287ddc7fba99094bdf56905f8fcb782d73770","observation_id":"9c4e75a6-2522-421d-b4b1-ddddd8ee115b","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:00:24.297044Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T15:00:24.297044Z"},"links":{"citing_paper":"/paper/2606.02168"},"observation_digest":"sha256:4a4d2d6015af68c148938cc1c25c1d4cbfb088425f4d6cc7505e167175d0c3ea","observation_id":"241e80d4-6cf4-4e75-9b52-4583a6893089","resolution":{"observed_at":"2026-06-28T15:00:24.297044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.02168","last_updated":"2026-06-01T12:28:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:28:37Z","title":"Disentanglement-Based Equivariant Learning for Compositional VQA"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":50,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2606.02168."}