ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

BDH-CQ模型以0.0007美元成本挑战ARC-AGI基准,揭示高效能AI推理新路径

BDH-CQ模型以0.0007美元成本挑战ARC-AGI基准,揭示高效能AI推理新路径 最近在AI研究圈里一个名为“BDH-CQ”的模型以极低的成本仅0.0007美元在“ARC-AGI”基准测试中取得了显著成绩引发了广泛讨论。这背后不仅仅是关于一个模型或一个榜单更触及了当前AI发展的核心议题我们距离真正的AGI通用人工智能还有多远以及实现智能突破是否必须依赖天价的算力本文将深入探讨这一事件拆解“BDH-CQ”模型的技术路径分析“ARC-AGI”基准测试的挑战与意义并探讨低成本AI模型对行业可能带来的深远影响。无论你是AI研究者、工程师还是对前沿技术趋势感兴趣的开发者都能从中获得关于AI能力边界、评估方法和未来方向的系统性认知。1. 背景与核心概念从ARC-AGI到BDH-CQ要理解“BDH-CQ以0.0007美元成本登ARC-AGI”这一事件我们首先需要厘清几个关键概念。1.1 什么是ARC-AGIARC-AGI全称为“Abstraction and Reasoning Corpus for Artificial General Intelligence”中文可译为“面向通用人工智能的抽象与推理语料库”。它由著名AI研究员François CholletKeras框架的创建者提出其核心理念是真正的智能在于解决前所未见的问题的能力而非对已知模式的大量记忆。ARC-AGI测试集包含一系列“核心任务”每个任务由几个输入-输出示例演示和一个需要推理的测试输入组成。模型的任务是仅通过观察少数几个示例就推断出背后抽象的、通用的转换规则并将其应用于全新的测试输入生成正确的输出。ARC-AGI的核心挑战在于小样本学习Few-shot Learning只给极少的示例通常3-5个。抽象推理Abstract Reasoning需要理解颜色、形状、位置、计数、对称、旋转等抽象概念及其组合规则。组合泛化Compositional Generalization将学到的简单规则组合起来解决更复杂的问题。避免记忆Memorization任务设计确保无法通过记住训练数据中的模式来作弊。因此ARC-AGI被视为衡量AI系统“通用推理能力”而非“特定任务熟练度”的一个严格基准。在它上面取得高分意味着模型具备了一定程度的、类似人类的“举一反三”的认知灵活性。1.2 BDH-CQ是什么“BDH-CQ”并非来自OpenAI、Google等巨头而是一个相对低调的研究成果。根据公开信息分析“BDH”很可能指代“BillionDollarHeuristic”十亿美元启发式或是一个研究小组/方法的缩写而“CQ”可能指“Cost-Query”成本查询或“CompositionalQuery”组合查询。更关键的是其宣称的0.0007美元的极低成本。这个成本数字极具冲击力。对比当前动辄需要数百万美元训练费用的GPT-4、Claude等大语言模型LLM0.0007美元约合人民币5分钱的成本几乎可以忽略不计。这暗示着BDH-CQ可能采用了一条完全不同的技术路径非Transformer架构可能基于更轻量级的模型如改进的MLP、RNN或专门为符号推理设计的架构。算法创新核心突破可能在于推理算法本身例如一种高效的搜索或规划算法能在极小的模型参数空间内完成复杂的推理步骤。数据高效利用可能极度依赖于任务本身的先验结构如网格世界、离散符号通过精心设计的程序合成或归纳逻辑编程来解决问题而非依赖海量数据训练。合成成本0.0007美元可能仅指“推理/测试”成本即运行一次模型解决一个ARC任务所需的计算费用而非训练成本。即便如此这个数字也低得惊人。1.3 为什么这件事重要这一事件的重要性体现在三个层面挑战“规模至上”的范式当前AI主流范式认为性能提升主要依赖于模型规模参数、数据规模和算力规模的同步扩大即“缩放定律”。BDH-CQ以极低成本在硬核推理基准上取得成绩是对这一范式的有力挑战证明智能可能源于精巧的设计而非单纯的暴力计算。重新定义AGI路径如果AGI的关键是抽象和推理能力那么像BDH-CQ这样专注于解决ARC-AGI的模型可能比单纯扩大语言模型更接近AGI的本质。它指向了一条**“能力优先而非规模优先”** 的AGI发展路径。降低AI门槛与风险极低的成本意味着更多的个人研究者和小型实验室可以参与到前沿AI研究中有助于促进创新多元化。同时这也引发了对AI安全的新思考如果一个强大的AGI核心如此“便宜”其可控性和安全性将面临全新挑战。2. 技术原理拆解BDH-CQ可能如何工作虽然BDH-CQ的具体实现细节未完全公开但我们可以基于ARC-AGI的任务特性、现有研究以及“低成本”这一线索推测其可能的技术原理。2.1 ARC-AGI任务的形式化描述一个典型的ARC-AGI任务可以形式化为输入一个训练集{ (input_i, output_i) } i1...k (k很小通常≤5)输出一个函数f使得对于给定的测试输入test_input有f(test_input) test_output(与ground truth一致)。任务发生在离散的二维网格上每个单元格有有限的几种颜色如0-9代表10种颜色。f需要捕捉的规则可能包括物体检测、移动、填充、计数、反射、旋转、模式扩展等。2.2 潜在技术路径分析结合现有学术界对ARC挑战的解决方案BDH-CQ可能采用了以下一种或多种技术的融合路径一基于符号推理与程序合成这是解决ARC类问题最经典的方法。其核心思想是将输入-输出对视为一个“程序”执行的结果目标是从示例中反推出这个“程序”。领域特定语言DSL首先设计一个用于描述网格变换操作的微型编程语言。例如包含基本操作FILTER(color),MOVE(direction),COUNT(),PAINT(region, color),REFLECT(axis)等。程序搜索给定输入-输出示例在DSL定义的程序空间中进行搜索找到一个能完美匹配所有示例的程序。这通常使用基于约束的搜索或概率编程技术。验证与泛化将找到的程序应用于测试输入生成预测输出。优势推理过程可解释不依赖大数据训练。挑战搜索空间随DSL复杂度指数增长需要高效的启发式搜索和剪枝策略。BDH-CQ的贡献可能发明了一种极其高效的搜索算法或DSL设计将每次查询解决一个任务的搜索成本降到了极低水平。路径二基于抽象表征学习的微型神经网络虽然Transformer大模型在ARC上表现一般它们更擅长关联而非演绎推理但专门设计的小型神经网络可能有效。架构设计使用卷积神经网络CNN或图神经网络GNN来理解网格的局部和全局结构。模型非常小可能只有几千或几万个参数。元学习Meta-Learning在大量类似的合成推理任务上进行“训练”学习如何快速适应新任务。这类似于“学会学习”。小样本推理在测试时将k个示例作为上下文输入模型模型通过内部快速调整如前馈调整或基于注意力的机制来推断规则并处理测试输入。优势具备一定的学习泛化能力。挑战需要精心设计任务分布来进行元训练且模型的可解释性较差。BDH-CQ的贡献可能找到了一个极其高效的任务分布和元学习目标使得小模型就能获得强大的推理能力且推理计算量极小。路径三神经符号混合系统结合上述两者的优点。神经感知器用一个轻量级神经网络如CNN将网格图像转换为中间符号表征如对象列表、关系图。符号推理引擎在符号层面使用逻辑推理或程序合成来寻找规则。符号到图像的渲染器将推理结果转换回网格输出。优势兼具神经网络的感知能力和符号系统的推理可解释性。挑战需要对齐神经和符号两个模块。BDH-CQ的贡献可能设计了一个无缝衔接的、计算开销极低的神经符号接口。“0.0007美元成本”的解读这个成本很可能是按云计算服务如AWS Lambda, Google Cloud Functions的每次函数调用解决一个ARC任务的成本来估算的。它反映了算法极高的计算效率——所需的CPU/内存资源和执行时间都极短。3. 环境与工具链设想如何复现类似研究如果你想深入探索或复现BDH-CQ这类低成本推理模型的研究需要搭建一个怎样的环境虽然我们无法精确还原BDH-CQ的栈但可以构建一个用于ARC-AGI问题研究的标准环境。3.1 核心工具与库# 1. 基础科学计算与深度学习框架 pip install numpy pandas matplotlib seaborn pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu # 根据CUDA版本调整 # 或使用 TensorFlow/JAX # pip install tensorflow # pip install jax jaxlib # 2. 程序合成与符号推理相关库 pip install z3-solver # Microsoft Z3定理证明器用于约束求解 pip install funcy pip install lark-parser # 用于构建DSL的解析器 # 3. ARC-AGI官方数据集与评估工具 # ARC数据集通常以JSON格式提供可以从官方渠道获取 # 评估脚本需要能计算准确率完全匹配输出网格 # 4. 元学习与小样本学习库可选 pip install higher # 用于PyTorch的元学习库 pip install learn2learn # 另一个元学习库3.2 项目结构建议arc-agi-research/ ├── data/ │ ├── ARC-V1-Feb2021/ # 官方数据集 │ │ ├── training/ │ │ ├── evaluation/ │ │ └── test/ │ └── custom_tasks/ # 自己生成的任务 ├── src/ │ ├── dsl/ # 领域特定语言定义 │ │ ├── __init__.py │ │ ├── grammar.py # DSL语法定义使用Lark │ │ └── operations.py # 基本操作实现 │ ├── synthesizer/ # 程序合成器 │ │ ├── __init__.py │ │ ├── search.py # 搜索算法BFS, DFS, 束搜索 │ │ └── constraint_solver.py # 基于Z3的求解器 │ ├── neural/ # 神经网络方法 │ │ ├── __init__.py │ │ ├── models.py # CNN/GNN模型定义 │ │ ├── meta_trainer.py # 元训练循环 │ │ └── fewshot_inference.py │ ├── evaluation/ │ │ └── evaluator.py # 任务加载与准确率计算 │ └── utils/ │ └── visualization.py # 可视化任务网格 ├── configs/ # 实验配置 ├── experiments/ # 实验日志与结果 ├── requirements.txt └── README.md3.3 低成本计算策略要实现“低成本”必须在算法和工程上双管齐下算法效率设计高度剪枝的搜索空间。使用缓存Memoization避免重复计算。采用近似算法在可接受的时间内找到“足够好”的解。工程优化使用Python的PyPy解释器替代CPython对计算密集型搜索任务可能有数倍提升。关键循环使用Cython或Numba进行加速。极致优化数据结构使用numpy数组操作替代Python原生循环。考虑使用无服务器计算Serverless如AWS Lambda按每次推理付费天然契合“按查询成本”的衡量方式。4. 实战案例构建一个极简的ARC程序合成器让我们动手实现一个基于DSL和深度优先搜索DFS的极简版程序合成器来直观感受一下解决ARC任务的核心逻辑。这个例子成本极低完全在本地CPU上运行。4.1 定义领域特定语言DSL首先我们定义一个非常简单的DSL只包含几种基本操作。# file: src/dsl/operations.py import numpy as np from typing import List, Tuple, Optional, Callable Grid np.ndarray # 2D array of integers representing colors def apply_op(grid: Grid, op_name: str, *args) - Optional[Grid]: 应用一个操作到网格上返回新网格失败则返回None。 try: if op_name IDENTITY: return grid.copy() elif op_name FILTER_COLOR: color args[0] # 只保留特定颜色的单元格其他变0背景色 new_grid np.where(grid color, grid, 0) return new_grid elif op_name PAINT_ALL: color args[0] # 将所有非零单元格涂成指定颜色 new_grid np.where(grid ! 0, color, 0) return new_grid elif op_name CROP: # 一个简单的裁剪移除全为0的行和列 non_zero_rows np.any(grid ! 0, axis1) non_zero_cols np.any(grid ! 0, axis0) if not np.any(non_zero_rows) or not np.any(non_zero_cols): return None new_grid grid[non_zero_rows, :][:, non_zero_cols] return new_grid elif op_name H_FLIP: # 水平翻转 return np.fliplr(grid) elif op_name V_FLIP: # 垂直翻转 return np.flipud(grid) else: return None except Exception: return None # 定义操作库 OPERATIONS [ (IDENTITY, []), (FILTER_COLOR, [1, 2, 3, 4, 5, 6, 7, 8, 9]), # 颜色参数 (PAINT_ALL, [1, 2, 3, 4, 5, 6, 7, 8, 9]), (CROP, []), (H_FLIP, []), (V_FLIP, []), ] # 操作可以组合我们允许最多3个操作的简单序列 MAX_PROGRAM_LENGTH 34.2 实现深度优先搜索合成器# file: src/synthesizer/search.py import itertools from typing import List, Tuple, Optional from src.dsl.operations import Grid, apply_op, OPERATIONS, MAX_PROGRAM_LENGTH def grid_equal(g1: Grid, g2: Grid) - bool: 严格比较两个网格是否完全相同。 return g1.shape g2.shape and np.array_equal(g1, g2) def dfs_synthesize(train_inputs: List[Grid], train_outputs: List[Grid], max_depth: int MAX_PROGRAM_LENGTH) - Optional[List[Tuple]]: 使用深度优先搜索合成一个程序操作序列。 程序必须对所有的训练输入-输出对都成立。 def dfs(program: List[Tuple], depth: int): 递归搜索函数。 if depth max_depth: return None # 尝试扩展程序 for op_name, arg_list in OPERATIONS: if not arg_list: # 无参数操作 candidate_args [()] else: # 有参数操作遍历可能的参数组合这里简化只取第一个参数 candidate_args [(arg,) for arg in arg_list[:3]] # 限制参数尝试数量以控制搜索 for args in candidate_args: new_step (op_name, *args) new_program program [new_step] # 验证当前程序在所有训练示例上是否一致 consistent True for inp, expected_out in zip(train_inputs, train_outputs): current_grid inp.copy() valid True for step in new_program: op_name_s, *args_s step current_grid apply_op(current_grid, op_name_s, *args_s) if current_grid is None: valid False break if not valid or not grid_equal(current_grid, expected_out): consistent False break if consistent: # 找到一致的程序 return new_program # 否则继续递归搜索 result dfs(new_program, depth 1) if result is not None: return result return None return dfs([], 0) def execute_program(program: List[Tuple], input_grid: Grid) - Optional[Grid]: 执行合成出的程序。 grid input_grid.copy() for step in program: op_name, *args step grid apply_op(grid, op_name, *args) if grid is None: return None return grid4.3 加载ARC任务与测试我们需要一个函数来加载和格式化ARC任务数据。这里我们创建一个模拟的简单任务来测试。# file: src/evaluation/evaluator.py import json import numpy as np from pathlib import Path from typing import Dict, List, Any from src.synthesizer.search import dfs_synthesize, execute_program def load_task_json(filepath: Path) - Dict[str, Any]: with open(filepath, r) as f: return json.load(f) def parse_grid(grid_data: List[List[int]]) - np.ndarray: return np.array(grid_data, dtypenp.int8) def solve_one_task(task_data: Dict, max_depth: int 3) - Dict: 尝试解决一个ARC任务。 返回包含预测输出和程序的信息。 train_pairs task_data.get(train, []) test_pairs task_data.get(test, []) if not train_pairs or not test_pairs: return {error: No train or test pairs} # 准备训练数据 train_inputs [parse_grid(pair[input]) for pair in train_pairs] train_outputs [parse_grid(pair[output]) for pair in train_pairs] # 程序合成 program dfs_synthesize(train_inputs, train_outputs, max_depthmax_depth) results [] for test_pair in test_pairs: test_input parse_grid(test_pair[input]) if program is None: pred_output None success False else: pred_output execute_program(program, test_input) expected_output parse_grid(test_pair[output]) success pred_output is not None and np.array_equal(pred_output, expected_output) results.append({ test_input: test_input.tolist(), predicted_output: pred_output.tolist() if pred_output is not None else None, success: success, program: program }) overall_success all(r[success] for r in results) return { task_id: task_data.get(id, unknown), program_found: program is not None, program: program, results: results, solved: overall_success } # 创建一个模拟的简单ARC任务进行测试 def create_demo_task(): 创建一个‘过滤红色并水平翻转’的演示任务。 # 颜色0黑1红2绿 train_input_1 [[1, 2, 0], [0, 1, 2], [2, 0, 1]] train_output_1 [[0, 1, 0], [0, 0, 1], [1, 0, 0]] # 过滤红色(1)然后水平翻转 这里我们设计一个简单的任务先过滤红色然后水平翻转。 # 手动计算一下过滤红色后 - [[1,0,0],[0,1,0],[0,0,1]]水平翻转后 - [[0,0,1],[0,1,0],[1,0,0]] # 嗯我们的DSL需要能组合操作。让我们调整DSL和搜索来支持序列。 # 更简单的任务只进行水平翻转 train_input_simple [[1,2,3],[4,5,6]] train_output_simple [[3,2,1],[6,5,4]] # 水平翻转 test_input_simple [[9,8,7],[0,1,2]] test_output_simple [[7,8,9],[2,1,0]] task { id: demo_h_flip, train: [ {input: train_input_simple, output: train_output_simple} ], test: [ {input: test_input_simple, output: test_output_simple} ] } return task if __name__ __main__: # 运行演示 demo_task create_demo_task() result solve_one_task(demo_task, max_depth2) print(fTask ID: {result[task_id]}) print(fProgram Found: {result[program_found]}) print(fProgram: {result[program]}) print(fSolved: {result[solved]}) if result[program]: print(Program steps:) for step in result[program]: print(f - {step})运行上述演示代码我们的极简合成器应该能成功找到[(H_FLIP,)]这个程序并解决测试案例。这虽然距离真正的ARC-AGI挑战相差甚远但清晰地展示了程序合成这一核心思想从输入-输出示例中自动发现一个可执行的变换序列。4.4 成本估算分析让我们粗略估算一下这个极简合成器解决一个简单任务的成本按云函数调用计费内存约128 MBPython运行时 numpy。执行时间对于简单任务操作库小搜索深度浅在普通CPU上约100-200毫秒。成本以AWS Lambda为例每GB-秒费用约为0.0000166667美元。我们的计算0.128 GB * 0.2 秒 * 0.0000166667 $/GB-s ≈ 0.000000427美元。这甚至远低于0.0007美元。这说明如果算法足够高效解决单次推理任务的云成本可以低到忽略不计。BDH-CQ的0.0007美元成本很可能包含了更复杂的操作库、更深的搜索深度以及更多的任务尝试但这个数量级是合理的。5. 深入挑战为什么ARC-AGI如此困难尽管我们的极简合成器能解决“水平翻转”这种规则明确的任务但ARC-AGI官方数据集中大多数任务要复杂得多。理解这些困难有助于我们明白BDH-CQ可能取得的突破在哪里。5.1 核心难点剖析组合爆炸Combinatorial Explosion即使是一个中等复杂度的DSL其程序空间也是天文数字。例如包含20种操作每个操作有若干参数程序长度允许到10步搜索空间的大小将是(20 * avg_args)^10无法进行暴力搜索。BDH-CQ的潜在解决方案使用强大的启发式函数、基于类型的剪枝、对称性约减或者将问题形式化为可满足性模理论SMT问题用Z3等求解器高效求解。模糊性与歧义Ambiguity仅凭少数示例推导出的规则可能不唯一。例如示例展示了一个点向右移动规则可能是“所有点右移”也可能是“每个点移动到最右边的空位”。模型必须选择最能泛化的那个。解决方案需要融入奥卡姆剃刀原则——偏好更简单、更短的程序。或者在元学习框架中从大量任务中学习到哪种规则先验更可能正确。感知与抽象Perception Abstraction人类能轻松地将网格中的像素群识别为“物体”、“线条”、“背景”并理解它们之间的关系。对于程序合成方法需要预先在DSL中定义好“物体检测”、“连通分量”等高级操作而这本身就是一个难题。神经符号混合路径试图用神经网络解决感知问题但如何让神经网络输出符号化的、可推理的表示仍然是一个开放问题。跨模态泛化ARC任务的核心是抽象规则它应独立于具体的颜色、网格大小和物体形状。模型必须剥离这些表面特征抓住深层关系。5.2 现有主流方法的局限性大型语言模型LLMs如GPT-4在ARC上表现不佳。它们擅长关联和模仿但在严格的演绎推理和小样本泛化上存在短板。它们可能会“编造”一个看似合理但错误的规则。纯视觉模型如CNN或Vision Transformer倾向于学习像素级的统计模式而非抽象规则容易过拟合到训练示例的表面特征上。强化学习搜索空间太大奖励稀疏只有最终输出完全正确才有奖励难以训练。6. BDH-CQ的启示与最佳实践假设BDH-CQ确实找到了一条有效的路径我们可以从中提炼出一些对AI研究和工程实践有价值的启示。6.1 算法设计最佳实践优先考虑可解释性在追求性能的同时设计能产生人类可理解如程序、逻辑公式输出的模型。这不仅能帮助调试更是实现可靠推理的关键。拥抱混合方法不要拘泥于“神经”或“符号”的派别之争。将神经网络的感知和泛化能力与符号系统的精确和可解释性结合起来可能是解决复杂推理问题的钥匙。重视搜索与规划算法许多AI难题本质上是搜索问题。投资于开发更高效、更智能的搜索算法如蒙特卡洛树搜索、神经启发式搜索其回报可能不亚于扩大模型规模。设计任务驱动的评估像ARC-AGI这样目标明确的基准非常重要。在开发新模型时应始终围绕其要解决的核心能力如组合泛化、小样本学习进行设计和评估。6.2 工程实现与成本控制极致优化对于研究原型也要有工程思维。分析性能瓶颈对关键路径进行优化使用更快的语言、并发、缓存。利用无服务器架构对于按查询付费的研究项目Serverless如AWS Lambda, Google Cloud Run是控制成本、简化运维的利器。确保你的代码是无状态和冷启动友好的。量化与评估成本将“每次推理成本”作为一个明确的评估指标。这迫使研究者思考算法的实际效率而不仅仅是准确率。开源与可复现性推动研究进步的最好方式是开源代码和模型。即使无法完全复现清晰的算法描述和伪代码也极具价值。6.3 对AGI研究的重新思考智能≠规模BDH-CQ提醒我们智能的涌现可能不需要巨大的参数规模而需要更精巧的架构和算法。我们应该投入更多资源探索高效能智能High-Efficiency Intelligence。关注核心推理能力与其追求模型在数百个任务上的平均性能不如深入攻克像ARC-AGI这样旨在测量核心推理能力的“硬骨头”。质的突破往往来自对根本问题的专注。跨学科借鉴从认知科学、逻辑学、程序语言理论中汲取灵感。人类如何思考我们如何形式化推理这些古老的问题可能蕴藏着AGI的关键。7. 常见问题与排查思路在尝试复现或借鉴BDH-CQ思路进行ARC-AGI研究时你可能会遇到以下问题问题现象可能原因解决思路程序合成器搜索时间过长无法在合理时间内找到解。1. DSL过于复杂搜索空间爆炸。2. 搜索算法如DFS效率低下缺乏剪枝。3. 任务本身太难超出当前DSL的表达能力。1.简化DSL从最小操作集开始逐步增加。2.改进搜索使用束搜索Beam Search、A*搜索需设计启发式函数、或转换为SMT问题用Z3求解。3.引入分层先合成子程序宏再组合。合成的程序在训练示例上正确但在测试示例上失败。1.过拟合程序只是“记住”了示例没有捕捉到通用规则。2.规则歧义示例不足以唯一确定规则合成器选择了错误的泛化。1.奥卡姆剃刀在搜索目标中引入程序长度惩罚偏好更短、更简单的程序。2.增加示例如果可能获取更多示例但ARC核心任务就是小样本。3.集成投票运行多个合成器不同随机种子/参数选择共识程序。神经网络模型在元训练集上过拟合在新任务上泛化差。1. 元训练任务分布与ARC核心任务分布不一致。2. 模型容量太大或太小。3. 元学习算法不稳定。1.改进任务生成器设计能更好模拟ARC任务分布的数据生成器。2.调整模型架构使用更适合推理的架构如关系网络Relation Network、图网络。3.正则化使用Dropout、权重衰减等。4.尝试MAML、Reptile等经典元学习算法。成本无法降到极低水平。1. 算法计算复杂度高。2. 实现存在性能瓶颈如Python循环。3. 使用了不必要的重型依赖如未优化的深度学习框架。1.性能剖析使用cProfile找出热点函数。2.关键代码用Cython/Numba重写或使用numpy向量化。3.考虑编译型语言对核心搜索算法用Rust/Go/C重写可能带来数量级提升。4.缓存中间结果。8. 总结与展望BDH-CQ以近乎象征性的成本在ARC-AGI基准上取得进展这一事件像一枚投入湖面的石子激起了关于AI发展路径的层层涟漪。它有力地证明了在通往AGI的道路上“大力出奇迹”的缩放定律并非唯一选项精巧的算法设计与对智能本质的深刻理解同样至关重要。对于开发者和研究者而言我们可以从以下几个方面继续探索深入理解ARC-AGI亲自尝试解决几个ARC任务感受其中的挑战。这能极大地提升你对“推理”和“泛化”的认识。实验混合架构不要害怕将经典的符号AI技术与现代深度学习结合。尝试设计一个神经感知前端符号推理后端的小型系统。关注成本效率在你的下一个研究项目中将“每次推理的计算成本”作为一个报告指标。这能促使你思考算法的实际可行性。参与社区ARC-AGI有一个活跃的研究社区。阅读相关论文参与讨论甚至向排行榜提交你的解决方案。AGI的旅程漫长而曲折但像BDH-CQ这样的工作提醒我们突破可能来自意想不到的方向而保持开放的心态和对基本原理的追求将是引领我们前进的明灯。
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表