ControlNet作者推新项目Omost 一句话变构图小作文 再也不用为写提示词头疼了
近日,ControlNet的作者推出了一个全新的项目——Omost。这个项目对现有图像模型的提示词理解有着巨大的帮助。通过很短的提示词,就可以生成非常详细并且空间表现很准确的图片。
Omost通过预定义的位置、偏移量和区域三大参数来简化图像元素的描述。这使得用户能够更直观地指定图像中各个元素的位置和大小,从而生成高质量、符合预期的图像。
使用Omost,你只需要输入简单的提示词,LLM就可以生成图像每个区域的简单提示和位置信息。然后针对图像九宫格的简单提示词继续扩展,保证了每一部分都有非常详细的描述。
比如,我输入创建一个梦幻的空中城堡,然后它给我返回了一段非常详细的图像描述:
这张照片展示了一座漂浮在高空的梦幻空中城堡,
“城堡完全由玻璃和闪闪发光的金属制成,反射出耀眼的阳光。”,
“精致的桥梁连接着各种塔,每座塔都装饰着复杂的雕刻和发光的符文。”,
“城堡周围的天空是柔和柔和色调的渐变,从黎明的粉红色过渡到黄昏的蓝色。”,
“下面是郁郁葱葱的森林、波光粼粼的河流和连绵起伏的山丘。”,
“整个场景笼罩在一种神奇的氛围中,柔和空灵的光束照亮了城堡,营造出一种奇妙和迷人的感觉。”
然后点击生成图像,它就会将上面的提示转化为图像返给你:
效果还不错。我们也可以将提示词复制到MJ中生成。效果如下:
更牛逼的是,Omost已经完成的图像整体布局可以保留,如果你想修改画面中的某个元素,也只需要一句提示词即可。比如你原来的画面主体是龙,你可以直接把龙变成恐龙。
项目亮点:
自动扩展提示词:Omost能够将简单的提示词拆解成详细的描述,从图像整体到局部元素的位置和大小均能详细说明。例如输入“a funny cartoon batman fights joker”,系统会生成蝙蝠侠与小丑战斗的完整图像。
高灵活性:生成的图像布局可以保留,用户可以通过简单的提示词对图像中的某个元素进行修改。比如,将龙变成恐龙,系统会根据新提示生成修改后的图像。
图像位置编码:Omost通过将图像划分为729个不同的位置来简化图像元素的描述。每个位置包括预定义的参数,如位置、偏移量和区域,确保图像生成的准确性和细致度。
子提示系统:所有Omost LLM都经过训练,可以提供严格定义的“子提示”,这些子提示可以独立描述事物,并任意组合形成完整的提示。这种设计提高了提示词的灵活性和准确性。
注意力操纵:Omost使用注意力分数调整技术来控制图像生成过程中的区域关注度,实现更精细的图像生成。通过调整注意力分数,Omost能够生成符合提示词描述的图像元素。
提示前缀树:Omost引入提示前缀树技术,通过合并子提示来改进提示理解和描述。例如,可以将路径“a cat and a dog. the cat on the sofa”作为提示,从而生成相应图像。
Omost的实现和使用
Omost项目基于Llama3和Phi3变体模型,用户可以通过提供简单的提示词来生成复杂的图像。以下是该项目的几个关键组件:
位置和偏移量:将图像划分为9个位置,每个位置进一步划分为81个偏移量,共有729个边界框,用于描述图像元素的位置。
distance_to_viewer和HTML_web_color_name:用于调整图像元素的视觉表现,通过组合这些参数可以生成粗略的图像构图。
注意力操纵:基于注意力分数操作的baseline渲染器,通过调整注意力分数来控制不同区域的模型关注度。
应用和前景
Omost技术的推出,不仅简化了提示词的编写,还提高了图像生成的精确度和灵活性。其应用场景包括但不限于AI绘画、图像设计、广告创意、教育等领域。用户可以通过简单的提示词生成复杂的图像,为创意设计提供了强大的工具支持。
项目页:https://top.aibase.com/tool/omost
试玩地址:https://huggingface.co/spaces/lllyasviel/Omost
作为商业顾问,我如何利用AI工具提升100%工作效率
各位一定很好奇,我们怎么又好久没发文章了?其实在过去一个月,我们潜心研究了各种AI技术在个人&企业场景的应用,并亲身加以实践,尝试用AI重塑自己的工作流。目的也非常纯粹:如何利用AI赋能业务增长、给企业降本增效?如何在不懂技术、不写代码的前提下,把AI能力用起来?站长网2023-07-28 09:06:5700012024年抖音春节消费报告:生活服务业日均消费规模同比增长153%
2月18日,抖音生活服务官方账号发布了《2024年春节消费数据报告》。报告显示,这个春节假期,无论是线上还是线下,消费活力均得到了充分释放。生活服务业的日均消费规模实现了同比增长153%,其中吃喝玩乐等行业的增长尤为显著。这种消费热潮不仅在大城市持续升温,更助力了小城经济的发展。据统计,有319万人选择返乡过年并积极参与探店活动,他们发布的探店视频为家乡带来了高达11.85亿元的经济收入。站长网2024-02-18 16:17:310002OpenAI拟在11月6日推出重大更新 为开发者降低开发成本
据路透社报道,OpenAI计划在下个月为开发者推出新的重大更新,以降低基于其人工智能模型的软件应用的开发成本和时间。这些更新包括添加内存存储功能,可以节省高达20倍的成本,以及新的视觉功能,使开发者能够构建具有分析图像并描述它们的能力的应用。OpenAI计划在11月6日举行的首次开发者大会上推出这些新功能,旨在鼓励企业使用OpenAI的技术来构建基于人工智能的聊天机器人和自主智能体。站长网2023-10-12 08:24:400000靠AIGC翻身,又遇比特币大涨,蔡文胜的美图「赌赢」了?
有这样一家曾因“炒币”亏损而上热搜的公司,在兜兜转转尝试无数赛道数年、亏损近20亿元后,转身发现自己一直守着的主营业务,在AI能力的加持之下,居然是这么大的一座金矿......3月15日,美图公司发布其2023年年度报告,财报显示,公司2023年营收收入约26.96亿元,同比增长29.27%,净利润为3.78亿元,同比增长301.8%。站长网2024-03-18 10:40:220000AI视野:英伟达发布大模型ChipNeMo;百度推出文心一言会员;OpenAI潜入黑客群聊;微软AI助手Copilot上线
🤖📈💻💡大模型动态英伟达发布430亿参数大模型ChipNeMo英伟达发布了拥有430亿参数的大语言模型ChipNeMo,专注于辅助芯片设计,提高工程师的工作效率,支持问答、EDA脚本生成和Bug总结等任务。【AiBase提要】🚀英伟达发布430亿参数的大语言模型ChipNeMo,用于辅助芯片设计。站长网2023-11-01 15:35:110000