관심사: AI, 투자, 독서, 데이터 플랫폼, Python, 레트로 게임/컴퓨터

Seoul, Korea
김정주 retweeted
이제는 FSD를 풀어야 할 때입니다. FSD가 미국을 시작으로 세계 곳곳에서 풀리고 있지만 우리는 FSD로 인한 대형 참사 소식을 듣지 못했습니다. 오히려 통계는 FSD가 인간 운전에 비해서 훨씬 안전하다는 것을 가리키고 있습니다. 자국 산업 보호를 위해 막을 수 없습니다. 안전을 생각할 때입니다.
68
187
886
59,821
귀여운 거위 형태 로봇이네요. 이 정도만 되어도 집에서 유용할 듯합니다. 뜬금없지만, 예전 닐스의 모험에서 봤던 거위 모르텐이 생각나네요~
Meet prototype 1 of the Goose, the family robot. We're building for the home: tidy, play, live.
1
7
549
Astra 에게 로봇팔의 눈과 손을 연결해 봤습니다. 👁 RealSense D435i 사양을 근사한 가상 RGB-D 카메라 📐 OpenCV로 색·위치 추정 🧠 Astra가 다음 행동 결정 🦾 MuJoCo 속 SO-101이 집기·운반·분류 카메라 관측에서 얻은 좌표로 빨강·파랑 큐브 4개를 같은 색 상자에 넣는 과제로, 잘 되나 속도가 너무 느리네요 (영상은 4X)
8
560
Jev 모델에 대해 조금 더 이해하고 싶으신 분들께 드리는 글. Jev를 딱 본 뒤 드는 첫 판단은 둘 중 하납니다. "저건 아예 LLM과 다르네", 혹은 "그냥 LLM의 출력헤드만 바꿨네" 뭐... 둘 다 맞는 말일 수 있습니다. Jev의 출력은 크게 세 가지 형태로 볼 수 있습니다. 1. Noul: yes/no 질문에 대해 0에서 1 사이의 확률을 반환. 2. Choice: 주어진 선택지 중 하나를 선택, 각 선택지의 확률 분포와 confidence를 함께 출력. 3. Score: 특정 척도 위에서 점수와 그 분포, 그리고 confidence를 출력. 즉 긴 자연어 답변을 생성(다음 토큰을 예측)하는 것이 아니라, 처음부터 의사결정에 필요한 값을 직접 출력하도록 만들어진 모델입니다. Noul의 확률은 그 자체로 0 또는 1이 아니라, 애플리케이션이 임계값을 정해 이진 결정으로 바꿀 수 있는 값입니다. 예를 들어 기상 데이터를 state로 넣고 "내일 비가 올 확률은?"이라는 question을 함께 입력한다고 생각해보겠습니다. 일반적인 LLM이라면 먼저 입력을 토큰 단위로 처리하고, 필요하다면 내부적인 reasoning을 거친 뒤 "내일 비가 올 확률은 약 80%입니다" 같은 텍스트를 생성합니다. 답변을 만들기 위해서는 여러 개의 토큰을 순차적으로 생성해야 합니다. Jev는 이 과정이 다릅니다. state(기상 데이터)와 typed question(내일 비가 올 확률은?)을 입력으로 받아 모델의 계산을 수행하고, 그 결과를 decision 형태로 바로 출력합니다. 결과가 "80%"에 해당하는 Score일 수도 있고, "비가 온다 / 오지 않는다" 중 하나를 고르는 Choice일 수도 있으며, "내일 비가 온다"는 명제의 참 확률을 내는 Noul일 수도 있습니다. 중요한 것은 모델이 답변을 설명하는 텍스트를 생성하는 것이 목적이 아니라, 주어진 state에 대한 question의 decision을 계산하는 것이 목적이라는 점입니다. 공개된 설명에 따르면 Jev는 여러 question을 같은 state에 대해 병렬로 평가하며, 일반적인 LLM처럼 토큰을 하나씩 이어 붙이며 글을 쓰지 않습니다. 그렇다고 Jev가 단순한 if문이나 규칙 기반 프로그램이라는 뜻은 아닙니다. 예를 들어 사람이 습도 > 80%이고 강수확률 > 60%이면 비 = 1 같은 규칙을 직접 작성해놓은 시스템과는 완전히 다릅니다. Jev 역시 학습된 신경망의 파라미터를 사용합니다. 입력은 여러 단계의 연산을 거치며 변환되고, 학습 과정에서 형성된 가중치에 의해 최종 출력이 결정됩니다. 따라서 특정 조건문을 사람이 하나하나 작성해놓은 것이 아니라, 학습을 통해 state와 question 사이의 관계를 모델의 파라미터에 내재화한 것에 가깝습니다. 이런 의미에서 Jev의 내부 구조를 기존 LLM과 완전히 다른 종류의 계산이라고 단정할 수 없습니다. Almeida는 인터뷰에서 “a different kind of language model”이라고 했습니다. 결국 언어모델이긴 한 거죠. 다만 현재 공개된 범위에서는 backbone이 Transformer인지, 기존 언어 모델을 얼마나 재사용했는지까지는 확인되지 않습니다. 언어를 입력으로 받아 그 분포나 의미를 모델링하면 language model이라고 부를 수 있으니... (n-gram, RNN, LSTM 등등) 아무튼 회사가 강조하는 차이는 레이어 구성의 이름보다, 새로운 모델 아키텍처와 parallel sampler를 사용해 구조화된 decision을 한 번에 산출하도록 설계했다는 점입니다. Attention이나 MLP 같은 구성요소를 쓸 수는 있지만, 그것은 현재로서는 추론이지 공개된 사실이 아닙니다. 차이에 대해 충분히 설명드린 것 같지만, 더 들어가보겠습니다. 일반적인 LLM의 대표적인 학습 목표는 주어진 문맥에서 다음 토큰을 예측하는 것입니다. 그래서 최종적으로 vocabulary 전체에 대한 확률 분포를 만들고, 그중 하나의 토큰을 선택해 다시 다음 토큰을 예측하는 과정을 반복합니다. 이후 RLHF 같은 방식으로 사람이 선호하는 글을 쓰도록 다듬는 경우가 많습니다. 반면 Jev는 처음부터 이런 텍스트 생성이 목적이 아닙니다. TypeSafe는 이를 Reinforcement Learning for Calibrated Decisions(RLCD)로 학습한다고 설명합니다. 즉, 모델이 최종적으로 해야 하는 일이 decision이라면, 그 decision과 함께 실제 정답률과 맞게 보정된 확률을 출력하도록 학습합니다. 따라서 텍스트 생성용 LM head로 문장을 이어 쓰는 대신, Noul, Choice, Score와 같은 decision output을 만들어내는 방향으로 모델을 사용합니다.. 여기에 Jev가 엄청나게 저렴한 이유가 있습니다. 일반 LLM은 답을 여러 번 순전파(파라미터 전체를 쭉 통과)해서 한 글자씩 만듭니다. 인풋이 길어질 수록 순전파를 토큰 수만큼 반복해 굉장히 느려지게 됩니다. 그래서 파라미터가 커질수록 일을 잘 하고 비싼 거죠. Jev는 인풋을 state, question 이 두 개로만 받습니다. 그리고 한 번의 순전파로 decision을 바로 냅니다. 그 정형화된 3개(Noul, Choice, Score)에 따라 decoding(최종 출력값 생성)도 끝납니다. 무시무시하게 저렴하고 빠른 이유죠. 즉, 즉즉즉즉즉... LLM은 "무슨 말을 다음에 생성할 것인가?"를 계산하고, Jev는 "현재 상태에서 어떤 판단을 내려야 하는가?"를 계산합니다. 그렇다고 Jev가 '의미'를 아예 버린 확률 계산기란 것도 또 아닙니다. 물론 reasoning trace를 생성하지 않는 것은 맞습니다. 일반적으로 생각하는 Reasoning 과정, 즉 문제를 여러 단계로 쪼개고 중간 결과를 글로 만들어가면서 최종 답을 도출하는 방식을 쓰지 않습니다. 신경망 내부에서는 당연히 입력된 값들의 관계를 표현하고 학습된 패턴을 이용합니다. 예를 들어 기상 데이터에서 기온, 습도, 기압, 바람, 구름 등의 여러 변수와 "내일 비가 올 확률"이라는 question 사이의 관계를 모델이 학습했다면, 이를 이용해 최종 Score나 Noul을 계산할 수 있습니다. 이 과정은 단순한 조건문보다 훨씬 복잡한 함수이며, 모델의 수많은 파라미터를 거쳐 수행됩니다. 따라서 Jev를 "추론을 전혀 하지 않는 모델"이라고 부르는 것도 정확하지 않습니다. 넓은 의미에서는 입력을 받아 내부 계산을 수행하고 결론을 도출하기 때문에 inference는 분명히 일어납니다. 다만 일반적인 reasoning LLM처럼 중간 추론을 토큰으로 생성하면서 답을 만들어내는 방식이 아니라, 학습된 신경망의 forward computation을 통해 decision을 직접 산출하는 방식이라고 이해하는 편이 정확합니다. 결국 LLM은 언어를 생성하는 범용 인터페이스에 가깝고, reasoning LLM은 그 언어 생성 과정에서 더 많은 계산을 사용해 복잡한 문제를 해결하도록 만들어집니다. Jev는 그와 달리 언어 생성 자체를 목적에서 빼고, state와 question으로부터 decision을 직접 계산하는 방향으로 설계된 모델입니다. 회사가 말하는 "can't hallucinate(할루시네이션이 불가)"도 사실이 틀리지 않는다는 뜻이 아니라, 미리 정한 스키마 밖의 답을 만들어내지 않는다는 뜻에 가깝습니다. 판단 자체는 틀릴 수 있습니다 ㅋㅋㅋ 한마디로 정리하면, Jev는 생각을 글로 써서 답을 만드는 모델이라기보다, 주어진 상태와 질문을 학습된 신경망에 통과시켜 필요한 decision을 직접 반환하는 모델이라고 볼 수 있습니다.
헉, 200배 빠르고 출력토큰이 영원히 0달러? 어떤 모델일까요? 바로 "Jev"입니다. Jev는 TypeSafe AI가 2026년 9월 15일 스텔스에서 나와 공개한 System One 계열의 첫 모델입니다. 따끈따끈하죠. ChatGPT/InstructGPT의 RLHF(랄프루프의 그것) 작업에 기여한 Diogo Almeida가 2인과 공동 창업했습니다. 핵심 철학은 “사람용 채팅 모델이 아니라 소프트웨어가 사용하는 의사결정 모델”입니다. Almeida는 “우리는 prod를 만들지, 신을 만들지 않는다”고 말합니다. 기존 LLM이 토큰을 하나씩 생성해 글을 쓰는 반면, Jev는 상태(state)를 넣고 미리 정의한 질문을 병렬로 평가해 타입이 정해진 답 + 확률 분포 + 신뢰도만 돌려줍니다. 즉, 텍스트를 생성하지 않기 때문에 전통적인 환각(잘못된 문장 생성)이 구조적으로 불가능합니다. 어떻게 쓰는가... 하면 입력은 state(티켓 본문, 문서, 로그 등)와 여러 개의 typed question이며, 질문은 세 종류로 미리 정리되어 있습니다. Noul: “환불을 요청하는가?”처럼 참/거짓. 0~1 확률을 반환. Choice: 고정된 선택지 중 하나(예: billing / technical / returns)와 각 옵션 확률, confidence. Score: 루브릭에 따른 점수(예: 긴급도 low/medium/high)와 분포. 한 번의 API 호출에서 여러 질문을 동시에 던질 수 있고, 질문 수가 늘어도 응답 시간은 거의 늘지 않습니다. 복잡한 판단은 질문을 쪼개서 Jev에 맡긴 뒤, 코드에서 확률과 confidence를 보고 분기·에스컬레이션하는 방식입니다. 학습 방식은 RLCD(Reinforcement Learning for Calibrated Decisions)입니다. RLHF가 “사람이 좋아하는 답”을 최적화했다면, RLCD는 “실제 결과에 맞게 확률이 캘리브레이션된 결정”을 최적화합니다. 뭔가 좀 복잡하긴 하죠. 그럼 가격은 어떨까요. 입력 토큰만 받습니다. 10억 개당 42달러($0.042/MTok). 출력 토큰은 “너무 싸서 계량할 가치가 없다”며 영원히 무료. 이름은 제본스의 역설(Jevons paradox)에서 따왔다고 합니다. 효율이 올라가면 사용량이 폭증한다는 의미로, “더 똑똑한 모델 한 방”보다 “훨씬 싸고 빠른 결정을 대량으로 넣는 것”이 자동화의 지름길이라는 입장인 거죠. 사실상 저희가 쓰고 있는 LLM과는 많이 다른 물건이라 써먹기 좋은 곳과 안 맞는 곳이 확연히 차이납니다. 티켓 라우팅, 고객 불만·긴급도 스코어링, 보험 언더라이팅 판단, 실시간 필터/게이트, 대량 데이터에 대한 map-reduce식 분류, 에이전트 워크플로 안의 “작은 판단”을 수천 번 반복하는 경우는 정말 잘 맞습니다. 반대로 채팅, 코드 작성, 긴 설명, 창작, 자유 형식 추론 같은 “텍스트를 생성하는 경우”에는 그냥 못 씁니다. Jev는 일반 LLM을 대체하는 모델이 아닙니다. 한 리뷰는 “수천 번의 작은 의미 판단을 하는 팀에 가치가 있지, 더 좋은 ChatGPT를 원하는 사람에게는 아니다”라고 정리했습니다. Hacker News 등에서는 “대형 분류기/스코어러를 프론티어 모델처럼 포장했다”는 비판도 있는데, 확실히 재미있고 유용한 프로젝트인건 맞아 보입니다. 현재는 얼리 액세스(웨이팅리스트) 단계입니다.
14
74
269
74,574
언젠가는 생성형 AI 기반 월드모델이 게임을 대체할 듯하지만, 아직 일관성/상태 보존/규칙 적용 등의 문제가 있습니다. Alaya Lab 의 Programmable World Model 은 이것을 풀기 위한 연구입니다. alaya-lab.github.io/pwm/ - 월드 상태·규칙은 3D 박스 기반 게임 엔진이 코드로 돌리고, - 비디오 생성 모델은 엔진을 참조하여 렌더링만 맡는 구조 - 화면 밖 개체, 인벤토리, 사망 같은 상태가 영상에 일관되게 반영됨 - 캐릭터 수 정확도 94%, 상태 반영 98% (기존 모델 최고 41%/58%)
2
259
폭주하는 AI 관련 타임라인에 고통받는 사람들..
incredible timeline
Made with AI
8
9
825
요즘 초파리 뇌를 이용한 다양한 시도가 많아 찾아보았습니다: - 뇌의 "복원"이 아니라 배선도인 커넥톰 (Connectome) 이용 - 뉴런 연결과 시냅스 개수만 있고 연결의 세기·호르몬·전기적 성질은 없음. 시냅스는 흥분/억제 두 값으로 단순화 - 시뮬레이션은 학습도 보상도 없는 고정 회로 방식 (게임·로봇 영상류), 또는 커넥톰을 가중치 마스크로만 써서 학습하는 방식 - 감각 입력은 커넥톰에 라벨된 감각 뉴런을 직접 발화시키는 방식. 실제 자극 변환 과정은 없음 - 뇌 출력 → 행동 매핑은 사람이 손으로 배선 (작위성 있을 수 있음) - 동작 대부분은 스크립트나 별도 모듈이 만들고, 뇌는 언제 어느 걸 트리거할지만 정함 - 그럼에도, 시뮬레이션이 지목한 뉴런 11 개 중 10 개가 실제 초파리에서 예측대로 작동한 건 놀라운 결과 - 뉴럴넷 대비 우위 사례가 있지만 한정적. 참고할 만한 건 회로의 설계 원리
the fly is deploying databases
3
91
373
38,056
Astra 로 만든 아이폰 듀오와 아이패드 미니 비교. 듀오의 무게 (254g) 는 폰으로는 너무 무거운데, 태블릿인 아이패드 미니 (297g) 와 비교하면 또 가벼움.. 🤔
I wanted to see a comparison between the iPhone Duo and iPad mini, so I asked Astra via the MagicPath plugin in ChatGPT, and boom. The age of wonder.
1,417
극단적으로 가벼운 논리 게이트 신경망 (Logic Gate Neural Network). - 일본의 한 프로젝트 팀이 개발 중인 논리 게이트형 AI 라이브러리 - 단 29 개의 논리 게이트만으로 마리오를 조작하는 데 성공 - 일반 뉴럴넷의 부동소수점 곱셈·덧셈 대신 AND / OR / XOR 같은 게이트 회로로 신경망을 구성 - 학습 시에는 미분 가능한 형태로 '완화' 했다가, 학습이 끝나면 진짜 이산 회로로 수축 - 게이트 출력은 0/1 뿐이라 기울기가 없어 역전파 불가 - 학습 시 입력을 0~1 사이 확률값으로 보고, 부드러운 근사식 사용 (AND ≈ a·b, OR ≈ a + b − a·b) - 각 노드는 16 종 게이트의 소프트 버전을 모두 만든 뒤 학습 가능한 점수로 가중 평균 - 학습 종료 후 점수가 가장 높은 게이트 하나만 남겨 진짜 게이트로 ('소프트 → 하드' 변환) - 기존 신경망과 달리 0/1 스위치 중심 → 나노초급 속도, 극도로 낮은 전력 소모 - 실시간·저전력이 필요한 엣지 디바이스 컨트롤러에 적합 단, 29 개 게이트로 모든 마리오 스테이지 클리어나 일반화를 보장하기는 어렵고, 소프트 게이트를 하드 게이트로 변환하는 과정에서 정밀도가 떨어지는 구조.
一款新型的神经网络,仅用29个逻辑门就能玩马里奥,基于逻辑门的神经网络模型技术。 具体原理: 「逻辑门神经网络」——不是普通神经网络那种浮点乘加,而是 AND / OR / XOR 这类门电路。训练时把门放松成可微分形式,学完再收成真正的离散电路。 逻辑门输出只有 0 和 1,中间没有平滑斜坡,所以不能用“求导”那套办法训练。这样就有平滑曲线,可以求导。 学完再把每个节点「拍死」成一种真的 AND/OR/XOR。训练时不直接用真门(无法微分的原因),换成「软门」:输入先当成 0 到 1 的小数(像概率) AND 近似成乘法:a⋅ba \cdot ba \cdot b OR 近似成:a+b−a⋅ba + b - a \cdot ba + b - a \cdot b 软门不是新硬件,只是训练时的「假开关」,好让误差能往回传。每个节点不是先选定「我是 AND」或「我是 OR」,而是:16 种真门各做一个软版本(AND 用乘法,OR 用上面那式,XOR 也有对应平滑式……) 用一组可学习的分数,把 16 种结果加权平均 谁对最终对错更有用,谁的分数就被梯度推高 训完再看:这个节点分数最高的是哪种门,就把它焊死成那种真门。 他是怎么把训练的转换成真实的门操作的呢呢 训练时每个节点同时“假装”16 种门,学完只留分数最高的那一种 和传统LLM体系模型的区别: 普通神经网络推理要:大量乘加 浮点数 电、热、显卡 逻辑门电路推理是:基本就是 0/1 开关 可以快到纳秒级 功耗可以极低 适合 FPGA、专用芯片、传感器边上的小控制器 所以它更对口的不是「代替 ChatGPT」,而是:玩具、家电、无人机飞控里的小决策 工厂里要实时、要省电的开关逻辑 边端设备:不能联网、不能带显卡 物理世界控制(他们说的 physical AI):看见障碍就拐、该跳就跳 所以它替代不了 ChatGPT,也很难单靠 29 个门打通所有马里奥关卡还保证泛化。它明显不如传统的地方训练别扭:先造软门,再拍成硬门,精度会掉一截。 参考资料:【预测】2026年,基于逻辑门的神经网络将迎来爆发式发展。 zenn.dev/teba_eleven/article…
6
33
3,436
OpenAI Astra 를 CARLA 드라이빙 시뮬레이터에서 고수준 플래너로 붙여본 자율주행 실험입니다. VLA 류는 아닌, VLM 플래너 + 고전 제어기 방식입니다. - 카메라 이미지 + 차량 텔레메트리만 보고 waypoint 6개 (4~10) 와 목표 속도를 제안 - 단순 경로 추종 컨트롤러가 20Hz 로 진행. - 장애물 회피·차선 보정 로직은 별도로 없음, 전부 모델 판단 - 어려운 코스는 high effort 필요 - 한계는 비용과 지연
looks like astra can also drive you around! made a custom env with carla sim and a number of obstacles, with astra used as a high level planner, and seems to nail pretty much every situation. more details in the thread
2
13
1,795
dream-loop 는 Astra 에서 Blender, 이미지 생성 AI, 서브에이전트 비평가 (Critic) 를 결합하여 고품질 3D 씬·앱·게임을 구축하는 스킬입니다. - AI가 이미지 생성으로 목표가 될 고품질 스크린샷을 생성 - AI가 해당 목표 이미지에 맞춰 3D 그래픽을 작업 - 별도의 서브에이전트 비평가가 결과물을 목표 이미지와 비교하여 피드백 제공 - 비평가가 만족할 때까지 루프를 반복하여 완성도를 극대화 🔗 github.com/achimala/dream-lo…
1
3
12
822
오늘의 Astra 작품 (Blender CLI 원샷).
1
1
7
780
김정주 retweeted
한국에서 많은 자율주행이 경쟁해야 합니다. 그래야 우리도 싸워서 경쟁력을 키울 수 있습니다. 세상 그 어떤 것도 직접 경험하기 전까지는 만들어 낼 수 없고, 우리를 지켜준다고 믿는게 실은 우리를 도태시키는 겁니다.
미국에서 무인 로보택시를 상용 운영하는 웨이모가 한국 시장 진출 의지를 공개적으로 밝혔습니다. 7월 24일 국내 법인을 설립한 지 약 한 달 반 만입니다. 다만 국내 시험운행이나 서비스 개시 시점 등 구체적인 사업 계획은 공개하지 않았습니다. 스티븐 한 웨이모코리아 대표 겸 웨이모 전무는 7일 서울 중구 웨스틴 조선 서울에서 열린 ‘2026 글로벌 모빌리티 콘퍼런스’ 기조연설에서 “2027년과 그 이후를 바라보며 도쿄와 런던을 포함한 해외 시장으로 영역을 확대할 계획”이라며 “한국에도 꼭 오고 싶다”고 말했습니다. bloter.net/news/articleView.…
11
36
219
8,544