Best AI Websites & Tools

AI产品榜

AI产品榜

AIM

大规模自回归图像模型预训练

普通产品图像视觉模型自回归预训练

这篇论文介绍了AIM，这是一组使用自回归目标进行预训练的视觉模型。这些模型受其文本对应物，即大型语言模型（LLMs）的启发，并表现出类似的扩展特性。具体来说，我们强调了两个关键发现：（1）视觉特征的性能随着模型容量和数据量的增加而提高，（2）目标函数的价值与模型在下游任务上的性能相关。我们通过在20亿张图像上对70亿参数的AIM进行预训练，实现了在ImageNet-1k上使用冻结主干达到84.0%的准确率。有趣的是，即使在这个规模上，我们观察到性能没有饱和的迹象，这表明AIM可能代表了训练大规模视觉模型的新前沿。AIM的预训练类似于LLMs的预训练，并不需要任何图像特定的策略来稳定大规模训练。

AIM

自回归图像模型预训练
大规模视觉模型训练
性能优化和扩展

适用于大规模图像数据的自回归预训练，以及需要训练大规模视觉模型的场景。

用于自动驾驶系统中的大规模图像识别
在医学影像分析中的大规模数据预训练
应用于智能监控系统的大规模视觉模型训练

AIM 最新流量情况

月总访问量

4222678

跳出率

67.15%

平均页面访问数

2.0

平均访问时长

00:01:25

AIM 访问量趋势

AIM 访问地理位置分布

AIM 流量来源

AIM 替代品

Document Inlining — 利用复合AI技术，将文档内联处理，跨越模态差距。

生产力•LLM•视觉模型

InternViT-6B-448px-V2_5 — 基于InternViT-6B-448px-V1-5的增强版视觉模型

图像•视觉模型•特征提取

ReKep — 机器人操控的时空关系关键点约束推理

生产力•机器人操控•时空推理

Sapiens — 先进的人工智能视觉模型，专门分析和理解人类动作。

图像•视觉模型•人体动作分析

Wikipedia Semantic Search

Wikipedia Semantic Search — 探索维基百科的语义搜索能力。

其他•语义搜索•维基百科

MIT MAIA — 自动化解释性代理，提升AI模型透明度

生产力•AI解释性•自动化

LongVA — 从语言到视觉的长上下文转换模型

图像•长上下文•视觉模型

Florence-2-base — 先进的视觉基础模型，支持多种视觉和视觉-语言任务。

图像•视觉模型•多任务学习

Florence-2-large — 先进的视觉基础模型，支持多种视觉和视觉-语言任务

图像•视觉模型•多任务学习

Florence-2 — 一种统一的视觉任务基础模型。

生产力•视觉模型•多任务学习

llama3v — 基于llama3 8B的SOTA视觉模型

图像•视觉模型•多模态学习

Page Assist - A Web UI for Local AI Models — 利用本地 AI 模型为您提供网页浏览辅助

生产力•AI 模型•侧边栏

LaVi-Bridge — 连接不同语言模型和生成视觉模型进行文本到图像生成

图像•文本到图像生成•语言模型

VMamba — 视觉状态空间模型，线性复杂度，全局感知

图像•视觉模型•图像处理

Astraios — 参数高效Fine-tuning大型语言模型

生产力•语言模型•Fine-tuning

WEKA — 数据平台用于云和人工智能

生产力•数据平台•云